來源於:智譜認領“牛來”模型,跑在10萬張國產芯片上-開雲手機網頁登錄入口
發布時間:2026-08-29 02:46:18
文章摘要:
智譜認領“牛來”模型,跑在10萬張國產芯片上-開雲手機網頁登錄入口:智譜認領“牛來”模型,跑在10萬張國產芯片上-開雲手機網頁登錄入口 智譜認領“牛來”模型,跑在10萬張國產芯片上-開雲手機網頁登錄入口
(文/陳濟深 編輯/呂棟) 此前在海外開發者圈掀起熱議的牛來匿名模型“Ox-Alpha”(中文社區俗稱“牛來”),正式揭開了真實身份。智譜張國 8月26日晚,認領開雲官方平台入口智譜正式上線輕量旗艦多模態模型GLM-5.3-Flash,模型並在當天以MIT協議麵向全球完全開源。跑萬片上 在正式認領前,產芯Ox-Alpha在OpenRouter與OpenCode兩大海外主流聚合平台進行了多日匿名盲測。牛來首日便衝上OpenRouter榜首,智譜張國單日Token處理量達到平台此前曆史峰值的認領4倍;據OpenCode方麵稱,Ox-Alpha終結了此前DeepSeek連續56天的模型霸榜紀錄。 OpenRouter宣布Ox-Alpha真實身份為智譜GLM-5.3-Flash 圖片來源 OpenRouter OpenRouter公開數據顯示,在Ox-Alpha登頂後,產芯全平台調用量前五的牛來席位已全部被中國大模型占據。 Ox-Alpha登頂OpenRouter周榜,榜單前五均為中國模型 圖片來源 OpenRouter 觀察者網了解到,認領這股席卷海外開發者的超大規模並發流量,並非跑在傳統的海外算力底座上,而是由10萬張國產算力芯片組成的超大集群全程承載,累計處理請求流量高達62T Token。開雲官方平台入口 在國際評測機構Artificial Analysis發布的綜合智能指數(AA Intelligence Index)中,GLM-5.3-Flash斬獲57分,追平海外公認的頂級旗艦Claude Opus 4.8。而在實際調用價格上,該模型直接打到了後者的四十分之一。 GLM-5.3-Flash在Artificial Analysis智能指數與任務成本中的位置 圖片來源 智譜 8月27日,智譜(02513.HK)收漲12.62%,報1160港元/股,市值重返5000億港元。 這頭跑在10萬張國產芯片上的“純血國產牛”,不僅作為中國開源模型軍團的最新成果持續打破了海外巨頭“前沿智能必然昂貴”的溢價神話,更順勢接過了此前由DeepSeek樹立的平價大旗,在Agent生態中劃出一條全新的價格“斬殺線”,刷新了大模型產業落地競爭的新一輪競爭起點。 接力DeepSeek 7月底,DeepSeek-V4-Flash正式上線,憑借強勁的推理與代碼能力以及極低定價,迅速在行業內掀起降價潮,甚至直接倒逼OpenAI等海外大廠以打折促銷跟進,DeepSeek-V4-Flash在事實層麵成為了大模型行業的性價比斬殺線。在上線初期,該模型在OpenCode平台上的單日處理量迅速突破8萬億Token,第一次讓全球開發者體驗到不必盯著賬單跑長鏈路Agent任務的紅利。 然而,Agent時代的工作流對價格極度敏感。Agent的核心是後台長任務循環:讀取上下文、檢索代碼、調用工具、多輪試錯。一個任務可能反複循環幾十次,微小的Token價差在海量調用中會被成倍放大。 當8月17日0時起DeepSeek實行峰穀定價、高峰時段價格大幅上調後,平台日調用量從峰值回落超過一半,空出了近10萬億Token的龐大日常需求缺口。智譜以Ox-Alpha的匿名身份在此窗口期迅速切入,憑借以免費試用為主的盲測策略,承接了相當一部分外溢流量。 而在8月26日正式認領並開源後,GLM-5.3-Flash公布的商業定價進一步確立了其“價格屠夫”的地位,順勢刷新了這條斬殺線。 在商業定價上,GLM-5.3-Flash國內官方API標準定價為每百萬Token輸入0.8元、輸出2.8元,僅為GLM-5.3的十分之一;上線期間實行半價後,折算價格降至二十分之一。橫向對比調價後的DeepSeek-V4-Flash(穀時輸入1.5元、輸出4.5元),GLM-5.3-Flash在絕大多數常規輸入輸出場景下綜合賬單更低。 在國際市場上,該模型公布的輸入價格為0.3美元、輸出1.2美元,半價期間輸出價格僅為0.6美元,約為海外頂級模型Claude Opus 4.8官方價格(輸出25美元)的四十分之一,將前沿編程與Agent能力的門檻進一步拉低。 從後訓練轉向專屬架構:國產卡也跑得起 如果說此前GLM-5.2與GLM-5.3的連續發布,印證了智譜在後訓練(Post-training)與強化學習方法論上的積累,那麽GLM-5.3-Flash則展現了一條截然不同的技術路徑。 盡管冠以Flash之名,但智譜並沒有在既有的重型底座上繼續依靠蒸餾、剪枝或後訓練小修小補,而是選擇從第一行代碼和初始權重開始,為高並發、低成本的推理場景重新設計了一套經濟型專屬架構。 這套架構的核心在於對計算開銷的極端克製。模型總參數量為320B,但單次前向傳播的激活參數被壓縮到了僅18B,模型層數較上一代GLM-4.5的92層腰斬至45層。 觀察者網獲悉,該模型直接依托智譜最新的30T Token原生多模態預訓練語料從零構建。 測試數據顯示,GLM-5.3-Flash在綜合能力上超過了總參數量翻倍的上一代重型旗艦GLM-5.2(743B-A40B,AA指數53分),也領先於DeepSeek-V4-Pro正式版(53分)和DeepSeek-V4-Flash(52分)。在智譜自建的代碼基準Z.ai Code Bench中,其實際編程與工具調用體感同樣穩居第一梯隊。 在解決1M超長上下文的顯存與計算瓶頸上,該架構采用了稀疏注意力與線性注意力的混合設計。線性注意力通過遞歸機製以極低開銷捕獲局部依賴,稀疏注意力借助輕量索引器精準召回全局上下文。 在此基礎上,智譜自研的IndexPool技術通過加權池化將索引器緩存實現四合一壓縮,配合流形約束超連接(mHC)保障小激活參數下的擴展表現。相較於GLM-5.3,該模型的單Token注意力計算量下降了3.01倍,KV緩存占用降低4.44倍,從算法源頭上為國產算力的高效承載掃清了障礙。 過去,國產算力芯片很少直接麵對全球化、高並發、不可預測的突發流量大考。麵對1M長上下文和多模態對單卡顯存容量與互聯帶寬的極限擠壓,智譜在SGLang框架之上為國產算力構建了專屬推理服務棧。 在該技術棧中,智譜在底層結合了節點內張量並行、ReplaySSM、W8A8量化與INT8/FP8/BF16混合緩存量化技術,同時配合自研Layersplit與KV broadcast通信優化;在集群調度層麵,全麵上線生產級Encode–Prefill–Decode(EPD)分離式架構,將多模態編碼、提示詞預填和逐Token解碼拆分為相互獨立、動態擴縮容的工作池。整套複雜集群的編譯調優與算子開發,由GLM-5.3驅動的Infra Agent協同完成。 最終,這套運行在國產芯片上的服務棧端到端性能提升了3倍,硬件效率和單Token推理成本已基本追平主流英偉達GPU。 此外,GLM-5.3-Flash以320B-A18B的超輕激活結構與MIT協議開源,為國內芯片廠商提供了一套開箱即用的前沿模型標準載體,意味著更多國產硬件可以直接承載320B級別的前沿模型部署,降低了實際商業化推理的適配門檻。 原生多模態:打通視覺代碼與複雜生產力閉環 在實際應用能力上,GLM-5.3-Flash是GLM家族首個原生多模態模型。智譜將其多模態能力重點投向了“視覺編碼(Visual Coding)”領域,模型不僅能看懂靜態圖像,更能主動觀察代碼渲染出的圖形界麵、3D空間或交互動態,並依據視覺反饋進行自主糾錯與迭代。 在開發者社區披露的實測案例中,知名獨立開發者通過Ox-Alpha與GLM-5.3消耗近千億Token,自主編寫了50萬至60萬行代碼,端到端生成了一個超大規模的可玩Web遊戲。 在純視覺驅動下,模型僅憑外部素材便能通過Godot引擎還原出類《噴射戰士》的塗地對戰與類《胡鬧廚房》的協作玩法;在無外部素材輸入的情況下,模型依托自研視覺反饋流水線,在Blender中自主連續運行12個小時,完整搭建了一套1400至2000平方米、包含12個功能區的高精度天空餐廳與酒吧3D場景; 在工業製造領域,模型甚至能直接讀取CAD工程圖紙草稿,編寫出Python build123d參數化代碼,複刻複雜的3D機械零件。 模型讀取的CAD工程圖紙草稿 圖片來源 智譜 模型根據工程圖複刻的3D機械零件 圖片來源 智譜 在白領高階生產力場景中,該模型同樣具備直接交付能力。在金融場景下,模型能夠覆蓋從多源信息溯源研報、SOTP估值、三表勾稽複核到DCF敏感性分析;在商務場景中,模型能依據模板起草格式嚴謹的經銷合作協議,直接生成具備專業排版質感的Word與PPT文檔。 隨著大模型進入Agent落地期,行業競爭邏輯正在發生轉變。 單純在發布會上比拚Benchmark跑分已很難維持開發者的黏性,誰能把架構效率做到極致、用更低的實際賬單支撐起Agent全天候的長循環任務,誰才能真正成為開發者工具鏈中的默認選項。 就在智譜開源GLM-5.3-Flash的當晚,阿裏也幾乎同步推出了主打極低激活參數的Qwen3.8-Flash(采用下一代Next架構),兩家廠商不約而同地將發力點轉向了經濟型推理模型。 從最初依賴補貼打價格戰,到如今通過架構創新和軟硬協同壓低真實推理成本,中國AI廠商正在用更務實的工程解法,爭奪全球生產力底座的話語權。![]()
![]()
![]()
![]()
![]()
返回首頁