伦伦影院久久影视,天天操天天干天天射,ririsao久久精品一区 ,一本大道香蕉大久在红桃,999久久久免费精品国产色夜,色悠悠久久综合88,亚洲国产精品久久无套麻豆,亚洲香蕉毛片久久网站,一本一道久久综合狠狠老

0
  • 聊天消息
  • 系統消息
  • 評論與回復
登錄后你可以
  • 下載海量資料
  • 學習在線課程
  • 觀看技術視頻
  • 寫文章/發帖/加入社區
會員中心
創作中心

完善資料讓更多小伙伴認識你,還能領取20積分哦,立即完善>

3天內不再提示

商湯科技正式發布并開源全新多模態模型架構NEO

商湯科技SenseTime ? 來源:商湯科技SenseTime ? 2025-12-08 11:19 ? 次閱讀
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

商湯科技正式發布并開源了與南洋理工大學S-Lab合作研發的全新多模態模型架構 ——NEO,為日日新SenseNova多模態模型奠定了新一代架構的基石。

作為行業首個可用的、實現深層次融合的原生多模態架構(Native VLM),NEO從底層原理出發,打破了傳統“模塊化”范式的桎梏,以“專為多模態而生”的創新設計,通過核心架構層面的多模態深層融合,實現了性能、效率和通用性的整體突破,重新定義了多模態模型的效能邊界,標志著人工智能多模態技術正式邁入“原生架構”的新時代。

論文網址:https://arxiv.org/abs/2510.14979

Github開源網址:https://github.com/EvolvingLMMs-Lab/NEO(點擊閱讀原文即可跳轉)

打破瓶頸告別“拼湊”,擁抱“原生”

b8f02de6-cea4-11f0-8c8f-92fbcf53809c.png

當前,業內主流的多模態模型大多遵循“視覺編碼器+投影器+語言模型”的模塊化范式。這種基于大語言模型(LLM)的擴展方式,雖然實現了圖像輸入的兼容,但本質上仍以語言為中心,圖像與語言的融合僅停留在數據層面。這種“拼湊”式的設計不僅學習效率低下,更限制了模型在復雜多模態場景下(比如涉及圖像細節捕捉或復雜空間結構理解)的處理能力。

商湯NEO架構正是為了解決這一痛點而生。早在2024年下半年,商湯便在國內率先突破多模態原生融合訓練技術,以單一模型在SuperCLUE語言評測 和OpenCompass多模態評測中奪冠,并基于這一核心技術打造了日日新SenseNova 6.0,實現多模態推理能力領先。

之后,在2025年7月發布日日新SenseNova 6.5通過實現編碼器層面的早期融合,把多模態模型性價比提升3倍,并在國內率先推出商用級別的圖文交錯推理。商湯此次更進一步,徹底摒棄了傳統的模塊化結構,從底層原理出發,推出了從零設計的NEO原生架構。

三大內核創新實現視覺和語言的深層統一

b9474c02-cea4-11f0-8c8f-92fbcf53809c.png

NEO架構以極致效率和深度融合為核心理念,通過在注意力機制、位置編碼和語義映射三個關鍵維度的底層創新,讓模型天生具備了統一處理視覺與語言的能力:

原生圖塊嵌入(Native Patch Embedding):摒棄了離散的圖像tokenizer,通過獨創的Patch Embedding Layer (PEL)自底向上構建從像素到詞元的連續映射。這種設計能更精細地捕捉圖像細節,從根本上突破了主流模型的圖像建模瓶頸。

原生三維旋轉位置編碼(Native-RoPE):創新性地解耦了三維時空頻率分配,視覺維度采用高頻、文本維度采用低頻,完美適配兩種模態的自然結構。這使得NEO不僅能精準捕獲圖像的空間結構,更具備向視頻處理、跨幀建模等復雜場景無縫擴展的潛力。

原生多頭注意力(Native Multi-Head Attention):針對不同模態特點,NEO在統一框架下實現了文本token的自回歸注意力和視覺token的雙向注意力并存。這種設計極大地提升了模型對空間結構關聯的利用率,從而更好地支撐復雜的圖文混合理解與推理。

此外,配合創新的Pre-Buffer & Post-LLM雙階段融合訓練策略,NEO能夠在吸收原始LLM完整語言推理能力的同時,從零構建強大的視覺感知能力,徹底解決了傳統跨模態訓練中語言能力受損的難題。

實測表現:十分之一的數據追評旗艦級性能

在架構創新的驅動下,NEO展現出了驚人的數據效率與性能優勢:

極高數據效率:僅需業界同等性能模型1/10的數據量(3.9億圖像文本示例),NEO便能開發出頂尖的視覺感知能力。無需依賴海量數據及額外視覺編碼器,其簡潔的架構便能在多項視覺理解任務中追平Qwen2-VL、InternVL3等頂級模塊化旗艦模型。

性能卓越且均衡:在MMMU、MMB、MMStar、SEED-I、POPE等多項公開權威評測中,NEO架構均斬獲高分,展現出優于其他原生VLM的綜合性能,真正實現了原生架構的“精度無損”。

極致推理性價比:特別是在0.6B-8B的參數區間內,NEO在邊緣部署方面優勢顯著。它不僅實現了精度與效率的雙重躍遷,更大幅降低了推理成本,將多模態視覺感知的“性價比”推向了極致。

開源共建構建下一代AI基礎設施

b9a81af0-cea4-11f0-8c8f-92fbcf53809c.png

架構是模型的“骨架”,只有骨架扎實,才能支撐起多模態技術的未來。NEO 架構的早期融合設計支持任意分辨率與長圖像輸入,能夠無縫擴展至視頻、具身智能等前沿領域,實現了從底層到頂層、端到端的真正融合。

從應用角度,端到端的“原生一體化”設計,為機器人具身交互、智能終端多模態響應、視頻理解、3D交互及具身智能等多元化場景的應用,提供了堅實的技術支撐。

目前,商湯已正式開源基于NEO 架構的2B 與 9B兩種規格模型,以推動開源社區在原生多模態架構上的創新與應用。

商湯科技表示,致力于通過開源協作與場景落地雙輪驅動,將NEO 打造為可擴展、可復用的下一代 AI 基礎設施,推動原生多模態技術從實驗室走向廣泛的產業化應用,加速構建下一代產業級原生多模態技術標準。

聲明:本文內容及配圖由入駐作者撰寫或者入駐合作網站授權轉載。文章觀點僅代表作者本人,不代表電子發燒友網立場。文章及其配圖僅供工程師學習之用,如有內容侵權或者其他違規問題,請聯系本站處理。 舉報投訴
  • 開源
    +關注

    關注

    3

    文章

    4270

    瀏覽量

    46330
  • 模型
    +關注

    關注

    1

    文章

    3783

    瀏覽量

    52201
  • 商湯
    +關注

    關注

    0

    文章

    94

    瀏覽量

    4404

原文標題:從“數據融合”邁向“原生架構”:商湯發布 NEO 架構,重新定義多模態模型效能邊界

文章出處:【微信號:SenseTime2017,微信公眾號:商湯科技SenseTime】歡迎添加關注!文章轉載請注明出處。

收藏 人收藏
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

    評論

    相關推薦
    熱點推薦

    商湯技正開源空間智能模型日日新SenseNova-SI-1.3

    商湯技正開源空間智能模型日日新SenseNova-SI-1.3,在空間測量、視角轉換、綜合推理等核心任務中展現出顯著提升,另外對比之前的版本增強了回答簡答題的能力。
    的頭像 發表于 02-10 14:12 ?490次閱讀
    <b class='flag-5'>商湯</b>科<b class='flag-5'>技正</b>式<b class='flag-5'>開源</b>空間智能<b class='flag-5'>模型</b>日日新SenseNova-SI-1.3

    眾智FlagOS適配面壁智能開源模態模型MiniCPM-o 4.5

    2月3日,面壁智能正式發布開源了集語言、視覺、語音于一體的全模態模型 MiniCPM-o 4.5。作為首個全雙工全
    的頭像 發表于 02-09 14:45 ?878次閱讀
    眾智FlagOS適配面壁智能<b class='flag-5'>開源</b>全<b class='flag-5'>模態</b>大<b class='flag-5'>模型</b>MiniCPM-o 4.5

    商湯技正開源模態自主推理模型SenseNova-MARS

    今日,商湯正式開源模態自主推理模型 SenseNova-MARS(8B/32B 雙版本),其在
    的頭像 發表于 01-30 10:13 ?699次閱讀
    <b class='flag-5'>商湯</b>科<b class='flag-5'>技正</b>式<b class='flag-5'>開源</b><b class='flag-5'>多</b><b class='flag-5'>模態</b>自主推理<b class='flag-5'>模型</b>SenseNova-MARS

    商湯開源SenseNova-MARS:突破模態搜索推理天花板

    今日,商湯正式開源模態自主推理模型 SenseNova-MARS(8B/32B 雙版本),其在
    的頭像 發表于 01-29 23:53 ?209次閱讀
    <b class='flag-5'>商湯</b><b class='flag-5'>開源</b>SenseNova-MARS:突破<b class='flag-5'>多</b><b class='flag-5'>模態</b>搜索推理天花板

    商湯科技日日新V6.5榮獲2025年模態模型全國第一

    近日,權威大模型評測基準 SuperCLUE 發布《中文模態視覺語言模型測評基準12月報告》,商湯
    的頭像 發表于 01-06 14:44 ?790次閱讀
    <b class='flag-5'>商湯</b>科技日日新V6.5榮獲2025年<b class='flag-5'>多</b><b class='flag-5'>模態</b>大<b class='flag-5'>模型</b>全國第一

    格靈深瞳模態模型榮登InfoQ 2025中國技術力量年度榜單

    靈感實驗室聯合LLaVA社區發布模態模型LLaVA-OneVision-1.5,實現了訓練數據、代碼和模型權重的全鏈路
    的頭像 發表于 01-05 10:05 ?575次閱讀

    沐曦股份曦云C系列GPU Day 0適配智譜GLM-4.6V模態模型

    12月8日智譜AI發布開源 GLM-4.6V 系列模態模型,沐曦股份曦云C系列GPU完成D
    的頭像 發表于 12-17 14:28 ?689次閱讀
    沐曦股份曦云C系列GPU Day 0適配智譜GLM-4.6V<b class='flag-5'>多</b><b class='flag-5'>模態</b>大<b class='flag-5'>模型</b>

    商湯技正發布AI辦公智能體小浣熊3.0

    今天,商湯技正發布AI辦公智能體「小浣熊3.0」,三大躍遷讓AI從冰冷的工具,變成主動跑通結果的“AI辦公搭子”。
    的頭像 發表于 12-17 14:12 ?668次閱讀

    商湯科技日日新Seko系列模型與寒武紀成功適配

    12月15日,商湯科技基于在生成式AI與模態交互領域的技術積累,正式發布Seko2.0——行業首個劇集生成智能體。該智能體在
    的頭像 發表于 12-17 14:06 ?525次閱讀

    商湯日日新V6.5模態模型登頂全球權威榜單

    根據權威評測平臺OpenCompass模態模型學術榜單(Multi-modal Academic Leaderboard)最新數據顯示,商湯「日日新 V6.5」(SenseNova
    的頭像 發表于 09-10 09:55 ?867次閱讀

    商湯科技模態通用智能戰略思考

    時間是最好的試金石,AI領域尤其如此。當行業熱議大模型走向時,商湯早已錨定“模態通用智能”——這是我們以深厚研究積累和實踐反復驗證的可行路徑。
    的頭像 發表于 08-14 09:33 ?1253次閱讀

    “端云+模態”新范式:《移遠通信AI大模型技術方案白皮書》正式發布

    7月28日,移遠通信聯合智次方研究院正式發布《AI大模型技術方案白皮書》(以下簡稱“白皮書”)。這份白皮書系統梳理了AI大模型的技術特點、產業發展態勢與多元應用場景,以及移遠通信“端云+
    的頭像 發表于 07-28 13:08 ?1326次閱讀
    “端云+<b class='flag-5'>多</b><b class='flag-5'>模態</b>”新范式:《移遠通信AI大<b class='flag-5'>模型</b>技術方案白皮書》正式<b class='flag-5'>發布</b>

    商湯日日新SenseNova融合模態模型 國內首家獲得最高評級的大模型

    近日,中國信息通信研究院(以下簡稱“中國信通院”)完成可信AI模態模型首輪評估。 商湯日日新SenseNova融合模態
    的頭像 發表于 06-11 11:57 ?1493次閱讀

    愛芯通元NPU適配Qwen2.5-VL-3B視覺模態模型

    熟悉愛芯通元NPU的網友很清楚,從去年開始我們在端側模態模型適配上一直處于主動緊跟的節奏。先后適配了國內最早開源
    的頭像 發表于 04-21 10:56 ?3342次閱讀
    愛芯通元NPU適配Qwen2.5-VL-3B視覺<b class='flag-5'>多</b><b class='flag-5'>模態</b>大<b class='flag-5'>模型</b>

    海康威視發布模態模型AI融合巡檢超腦

    基于海康觀瀾大模型技術體系,海康威視推出新一代模態模型AI融合巡檢超腦,全面升級人、車、行為、事件等算法,為行業帶來全新
    的頭像 發表于 04-17 17:12 ?1706次閱讀