化:大模型下一階段演進(jìn)路線圖)
摘要大模型正在從「預(yù)訓(xùn)練 Scaling Law」邁向「Agentic Scaling」新階段——模型在環(huán)境交互中積累經(jīng)驗,在任務(wù)執(zhí)行中自我修正提升。本文確認(rèn)嘉賓(張俊林、俞揚、方斌、盧志武)對 Agentic Scaling、自進(jìn)化、MoE 架構(gòu)的判斷,梳理出大模型下一階段演進(jìn)的 3 條技術(shù)路線:后訓(xùn)練推理計算協(xié)同(方斌)、世界模型驅(qū)動的具身推理(俞揚)、多模態(tài)統(tǒng)一表征下的自進(jìn)化(盧志武、張俊林)。SEO關(guān)鍵詞:Agentic Scaling / 自進(jìn)化大模型 / 大模型后訓(xùn)練 / MoE 架構(gòu) / 推理計算協(xié)同 / 大模型演進(jìn) / 張俊林 / 俞揚 / 方斌 / 盧志武 / 2026 奇點智能大會一、為什么「Agentic Scaling」會成為本屆主基調(diào)過去 5 年,大模型能力提升主要靠預(yù)訓(xùn)練 Scaling Law——參數(shù)、數(shù)據(jù)、算力的指數(shù)級增長帶來模型能力的線性增長。但 2024 年開始,這個規(guī)律出現(xiàn)兩個拐點:數(shù)據(jù)瓶頸:高質(zhì)量文本數(shù)據(jù)即將耗盡,繼續(xù)堆數(shù)據(jù)帶來的邊際收益迅速下降推理成本拐點 系列證明,在推理時展開大量 token 進(jìn)行「思考」,能顯著提升復(fù)雜任務(wù)能力本屆大會把議題命名為「從 Agentic Scaling 到自進(jìn)化」,正是對這兩個拐點的回應(yīng)——大模型下一階段的能力提升,將主要靠推理時算力 工具調(diào)用 多步規(guī)劃的協(xié)同,而非純預(yù)訓(xùn)練參數(shù)堆疊。二、4 位嘉賓的判斷交叉驗證嘉賓學(xué)術(shù)/工業(yè)背景核心判斷工程關(guān)注點張俊林新浪微博首席科學(xué)家 · 工業(yè)落地視角推薦系統(tǒng)與大模型結(jié)合的下一站是「多模態(tài)推薦 推理協(xié)同」億級 DAU 場景的推理成本控制俞揚南大人工智能學(xué)院教授 · 強(qiáng)化學(xué)習(xí)方向Agentic Scaling 的本質(zhì)是「環(huán)境交互中學(xué)習(xí)」,與強(qiáng)化學(xué)習(xí)一脈相承Sim-to-Real、世界模型方斌北郵拔尖人才教授 · 后訓(xùn)練方向下一階段的關(guān)鍵是「后訓(xùn)練 推理計算協(xié)同」,過程獎勵模型將取代結(jié)果獎勵訓(xùn)練效率、PRM 工程實現(xiàn)盧志武人大高瓴 AI 學(xué)院教授 · 多模態(tài)方向真正的自進(jìn)化需要「多模態(tài)統(tǒng)一表征」,文字之外的視覺/音頻/3D 都是關(guān)鍵視頻生成、3D 空間理解三、3 條技術(shù)路線的深度對比? 路線 A:后訓(xùn)練 推理計算協(xié)同(方斌主張)核心論點:預(yù)訓(xùn)練已完成「知識灌注」,下一階段要靠后訓(xùn)練 推理時計算把模型從「直覺型」變成「思考型」。傳統(tǒng) SFT(監(jiān)督微調(diào))只對最終答案給獎勵,導(dǎo)致模型「知其然不知其所以然」。方斌主張用過程獎勵模型(PRM)替代結(jié)果獎勵模型(ORM)——對推理鏈中的每一步都給出獎勵信號。工程上的典型做法:# 偽代碼:過程獎勵模型(PRM)訓(xùn)練deftrain_prm(model,reasoning_steps,final_answer): reasoning_steps: 模型生成的中間推理步驟 final_answer: 最終答案 step_rewards[]fori,stepinenumerate(reasoning_steps):# 每一步都計算獎勵,而非只對最終答案給獎勵partial_answerexecute_step(reasoning_steps[:i1])step_rewardcompute_step_correctness(partial_answer,ground_truth)step_rewards.append(step_reward)# 用過程獎勵做策略梯度更新loss-policy_gradient(model,reasoning_steps,step_rewards)returnloss工程價值:訓(xùn)練效率比 ORM 高 5-10 倍,模型在數(shù)學(xué)競賽、博士級科學(xué)問答上的準(zhǔn)確率提升 20-30 個百分點。? 路線 B:世界模型驅(qū)動的具身推理(俞揚主張)核心論點:Agentic Scaling 的本質(zhì)是「在環(huán)境交互中學(xué)習(xí)」,這是強(qiáng)化學(xué)習(xí)的核心思想,也是 OpenAI 早期(從 DQN 到 AlphaGo)走過的路。俞揚長期研究強(qiáng)化學(xué)習(xí)與世界模型,主張下一階段的關(guān)鍵是讓模型具備對環(huán)境的預(yù)測能力——給定當(dāng)前狀態(tài),模型能預(yù)測「如果我執(zhí)行動作 A,會進(jìn)入什么狀態(tài) B」。工程上的典型做法:# 偽代碼:世界模型 策略網(wǎng)絡(luò)的協(xié)同訓(xùn)練classWorldModelAgent:def__init__(self):self.world_modelTransformerWorldModel()self.policy_netActorCritic()defimagine(self,current_state,horizon10):在世界模型中想象未來imagined_trajectory[current_state]statecurrent_statefor_inrange(horizon):actionself.policy_net.act(state)next_stateself.world_model.predict(state,action)imagined_trajectory.append(next_state)statenext_statereturnimagined_trajectorydeflearn(self,real_trajectory):用真實軌跡與世界模型想象軌跡做對比學(xué)習(xí)imaginedself.imagine(real_trajectory[0])losscontrastive_loss(imagined,real_trajectory)returnloss工程價值:在機(jī)器人、自動駕駛、游戲 AI 場景中,世界模型能讓模型用「想象」替代「真實試錯」,訓(xùn)練樣本效率提升 100 倍以上。? 路線 C:多模態(tài)統(tǒng)一表征下的自進(jìn)化(盧志武、張俊林主張)核心論點:真正的自進(jìn)化不能只靠文字信號,必須把視覺、音頻、3D、視頻都納入統(tǒng)一表征,讓模型能從多模態(tài)數(shù)據(jù)中持續(xù)學(xué)習(xí)。盧志武長期研究多模態(tài)表征統(tǒng)一,主張「同一模型理解圖像、視頻、音頻與文本并自由推理」是自進(jìn)化的基礎(chǔ)設(shè)施。張俊林則從工業(yè)落地角度補(bǔ)充:多模態(tài)推薦系統(tǒng)是驗證這一論點的最佳場景。工程上的典型挑戰(zhàn):不同模態(tài)的數(shù)據(jù)規(guī)模、token 化方式、計算密度差異巨大(視頻比文本重 1000 倍),如何在統(tǒng)一基座里平衡?模態(tài)數(shù)據(jù)規(guī)模Token 化計算密度統(tǒng)一表征挑戰(zhàn)文本10T token1 token ≈ 4 字符低已成熟圖像10B 圖Patch(16x16)中與文本對齊視頻100M 視頻幀 Patch 時間軸高顯存與時序建模3D10M 場景點云 / NeRF / Gaussian極高物理一致性音頻100K 小時頻譜幀中與文本時間對齊工程價值:多模態(tài)統(tǒng)一基座是具身智能(需要 3D 視覺)、視頻理解(需要時序建模)、推薦系統(tǒng)(需要文本圖像)等多個場景的共同基礎(chǔ)設(shè)施。四、MoE 架構(gòu)的工程權(quán)衡(4 位嘉賓共識)盡管路線不同,4 位嘉賓對MoE 架構(gòu)的判斷高度一致——MoE 已經(jīng)成為下一代大模型的事實標(biāo)準(zhǔn),但工程權(quán)衡遠(yuǎn)比理論復(fù)雜。維度Dense 模型MoE 模型訓(xùn)練算力全部參數(shù)參與僅激活部分專家(典型 8/64)推理成本與參數(shù)線性與激活專家數(shù)線性顯存占用與參數(shù)線性與總參數(shù)線性(全專家加載)工程復(fù)雜度低高(專家路由、負(fù)載均衡、通信)能力上限中高(總參數(shù)可到萬億級)部署門檻單卡可跑多卡/多機(jī)必需張晨(小米 AI 平臺部語言模型推理負(fù)責(zé)人)在 0821 版新加入主推議題里,會專門討論 MoE 在億級 DAU 場景下的工程實踐——如何在不損失推理質(zhì)量的前提下,把 MoE 的顯存和算力成本壓到極致。五、給工程師的 5 個具體行動建議不要押注單一路線:Agentic Scaling 的 3 條路線會同時存在,不同任務(wù)選擇不同路線——數(shù)學(xué)/代碼用 PRM,機(jī)器人/游戲用世界模型,內(nèi)容理解用多模態(tài)統(tǒng)一基座。重新設(shè)計訓(xùn)練-推理預(yù)算:從 80:20 倒置為 20:80,意味著基礎(chǔ)設(shè)施團(tuán)隊需要提前采購更多推理 GPU。建立過程獎勵模型的工程能力:PRM 是 o 系列的核心,但工程實現(xiàn)遠(yuǎn)比 ORM 復(fù)雜,需要專門的「推理步驟標(biāo)注流水線」。關(guān)注 MoE 的工程開銷:MoE 模型的訓(xùn)練-推理成本曲線不是線性的,專家路由策略、負(fù)載均衡、跨卡通信都是隱性成本。從演示級到生產(chǎn)級只差一個 Loop:把模型嵌入到「感知-思考-行動-反饋」的閉環(huán)里,這正是大會主題里「從 Harness 到 Loop」的含義。六、常見問題 FAQQ1:Agentic Scaling 和傳統(tǒng)預(yù)訓(xùn)練 Scaling 的核心區(qū)別是什么?傳統(tǒng)預(yù)訓(xùn)練 Scaling 關(guān)注訓(xùn)練時的參數(shù)/數(shù)據(jù)/算力規(guī)模,模型能力隨這三個維度的指數(shù)級增長而線性增長;Agentic Scaling 關(guān)注推理時的算力展開(token 數(shù)量、工具調(diào)用、多步規(guī)劃),模型能力靠推理時的「思考深度」而非「參數(shù)規(guī)模」提升。Q2:為什么這一屆大會把「自進(jìn)化」放到標(biāo)題里?因為模型能力的下一階段增長不再只依賴人類標(biāo)注數(shù)據(jù),而是依賴模型在生產(chǎn)環(huán)境與用戶交互中自動學(xué)習(xí)——每一步推理、每一次工具調(diào)用、每一個用戶反饋都是訓(xùn)練數(shù)據(jù)。這是從「被動學(xué)習(xí)」到「主動學(xué)習(xí)」的范式躍遷。Q3:MoE 架構(gòu)在工業(yè)部署中最大的挑戰(zhàn)是什么?顯存占用與跨卡通信。MoE 模型的全部專家必須常駐顯存(否則每次推理都要從存儲加載),但推理時只激活其中一部分——這導(dǎo)致顯存成本與 Dense 模型相當(dāng),但計算成本只有 1/8。跨卡通信開銷在多機(jī)部署時尤為突出,需要專家并行(Expert Parallel)與張量并行(TP)的協(xié)同。想現(xiàn)場與張俊林、俞揚、方斌、盧志武等 4 位嘉賓面對面深入交流,可前往奇點大會官方渠道免費領(lǐng)取大會 PPT 詳細(xì)資料。