過去兩年中,企業(yè)的 AI 戰(zhàn)略幾乎都遵循著同一種思路:以最快速度接觸前沿技術。默認路徑通常是申請一個公有云賬號、獲取來自 OpenAI 或 Anthropic 的 API Key,并愿意以成本換取速度。這種方式的確催生了大量創(chuàng)新項目,但如今已經(jīng)遇到了瓶頸。
Gartner 預測,到 2026 年,全球 AI 支出將達到 2.52 萬億美元,同比增長 44%,其中,僅 AI 基礎設施投入就將高達 1.37 萬億美元。事實上,早在 2025 年年中,Gartner 就指出,采購領域的 AI已進入“幻滅低谷期(Trough of Disillusionment)”,企業(yè)能否實現(xiàn)規(guī)模化落地,取決于是否具備可預測的投資回報率(ROI),而非停留在概念驗證階段。現(xiàn)在,企業(yè)面臨的核心問題,已經(jīng)從能否快速開展 AI 試點轉(zhuǎn)變?yōu)槟芊裨趯嶋H生產(chǎn)環(huán)境中長期、可控、可治理地運行 AI。
從“先進模型獲取”走向“推理經(jīng)濟學”
我們正在從 AI 1.0 邁向 AI 2.0。在 AI 1.0 時代,獲取最先進的大模型就可以獲得競爭優(yōu)勢。而在 AI 2.0 時代,推理經(jīng)濟學(Inference Economics)、數(shù)據(jù)引力( Data Gravity)、延遲以及控制能力將成為決定成敗的關鍵。自 2021 年以來,token 價格每年大約下降 10 倍,但大多數(shù)企業(yè)的AI總支出卻不降反升。原因在于更強大的模型也催生了更復雜的工作流需求。
Anthropic、OpenAI 和 Mistral 正在把產(chǎn)品線劃分為旗艦級推理模型和低成本通用模型,因為客戶不愿意為每一項任務都支付旗艦級模型的價格。《麥肯錫2025 AI現(xiàn)狀》報告證實了這一趨勢:AI的應用范圍正在擴大,但真正實現(xiàn)規(guī)模化價值的企業(yè)很少。其中,中國大陸有45%的受訪企業(yè)實現(xiàn)AI的規(guī)模化或全面部署,高于全球 38% 的均值,展現(xiàn)出在AI應用深度上的相對領先優(yōu)勢。CIO 現(xiàn)在關注的問題已不再是哪個模型更強,而是哪一種工作負載應該運行在哪個平臺上,成本是多少,以及遵循哪種治理策略。
“下一個最佳行動”測試
以銀行業(yè)一個典型場景為例:向客戶提供“下一個最佳行動(Next Best Action)”推薦——即基于客戶實時情境,在 App、網(wǎng)點或呼叫中心中,以毫秒級速度生成推薦內(nèi)容。Cloudera合作的領先銀行已經(jīng)證明,這種深度個性化服務能力能夠帶來 5% 至 15% 的收入提升。與Cloudera合作的一家全球性銀行推出的 AI 助手,在上線第一年就已處理超過 150 萬次客戶咨詢。
然而,推理成本的現(xiàn)實壓力不容忽視。一次智能體決策可能觸發(fā) 5 到 20 次模型調(diào)用,而每一次調(diào)用都帶有各自的上下文窗口。在單輪演示中,每百萬輸入 token 成本從 0.5 美元與 3.3 美元之間的差異看似微不足道,但在數(shù)億次客戶交互中,這種差異足以決定一個功能究竟是會盈利,還是在悄無聲息的持續(xù)燒錢。
近期研究顯示,如果企業(yè)在所有任務中使用頂級高級模型,其推理成本的浪費高達40% 至 85%。例如,Decagon 將架構遷移至基于 NVIDIA Blackwell 的開源多模型技術棧后,其每次語音查詢成本下降了 6 倍。“下一個最佳行動”已經(jīng)不再是營銷決策,而是一項單位經(jīng)濟學(unit economics)決策,并且是在每一次 token 路由過程中實時完成的。
主權正成為 AI 戰(zhàn)略核心
關于公有云 與 Private AI的爭論已不再是意識形態(tài)之爭,而是工作負載層面的現(xiàn)實選擇。同時,地緣政治因素也被納入討論范疇。
歐盟《AI 法案》(EU AI Act)中關于高風險 AI 系統(tǒng)的規(guī)定將于 2026 年 8 月全面生效,違規(guī)罰款最高可達 3,500 萬歐元或全球營業(yè)額7%的罰款。法國與德國也正逐步將國家級采購傾向于本國的Mistral AI 以及基于開放權重模型的主權 AI 技術棧 。
亞洲的 AI 監(jiān)管格局則呈現(xiàn)出更加多元化的發(fā)展路徑。新加坡的《 AI 治理框架》以及 IMDA 測試工具已成為該地區(qū)的范本;日本通過《 AI 推進法》在自愿性指導原則基礎上增加了行業(yè)監(jiān)管;韓國的《 AI 基本法》則要求高風險 AI 系統(tǒng)必須購買責任險。與此同時,印度在 2026 年 2 月 AI Impact Summit 上推出了本國主權大模型,并通過 IndiaAI Mission 計劃投入 12.5 億美元,其《數(shù)字個人數(shù)據(jù)保護法(DPDP Act)》也將持續(xù)推進至 2027 年。中國正在推動由國家主導的開源建設,同時也在不斷推動相關法律法規(guī)和標準的建立。例如,由中國牽頭立項的《生成式人工智能風險處理指南》國際標準目前已進入快速制定階段。此外,印度尼西亞實施《個人數(shù)據(jù)保護法(PDP Law)》,澳大利亞則采取更務實的行業(yè)監(jiān)管模式。在這樣各具特色的 AI 環(huán)境中,96% 的亞太企業(yè)計劃增加 AI 投入,且大多數(shù)將采用混合基礎設施架構。單一云平臺、單一司法轄區(qū)的 AI 架構,如今已經(jīng)成為一種結構性風險。
Cloudera 與 NVIDIA 在混合推理領域的合作,以及行業(yè)加速采用本地化 AI 部署以支持受監(jiān)管工作負載,正是這一趨勢的直接體現(xiàn)。
真正的護城河在模型之上
過去 18 個月中,企業(yè)獲得的深刻教訓是:模型商品化并不會降低企業(yè) AI 的復雜性,只是把復雜性轉(zhuǎn)移到了其他區(qū)域。Mistral、DeepSeek 提供的開放權重模型雖然降低了實驗成本,但協(xié)調(diào)、治理、評估和系統(tǒng)集成的復雜性卻轉(zhuǎn)移給了企業(yè)自身。
同樣的趨勢,如今也正在物理 AI 與國防科技領域上演。Physical Intelligence、Figure AI 和Skild AI 正推動機器人基礎模型進入工廠、物流中心與家庭。在這些場景中,低延遲、數(shù)據(jù)主權與數(shù)據(jù)駐留的重要性已經(jīng)超過了模型跑分本身。李飛飛創(chuàng)立的 World Labs正在構建空間智能層(Spatial Intelligence),即具備 3D 感知與推理能力的世界模型,該模型將成為下一代工業(yè)數(shù)字孿生系統(tǒng)的基礎。Palantir 與 Anduril 則圍繞一個核心假設建立了自己的商業(yè)版圖,他們認為,真正持久的競爭優(yōu)勢并不在于模型本身,而在于控制平面(Control Plane)。
企業(yè)領導者應當衡量每項有效任務的單位經(jīng)濟成本、每一個智能體部署的運營負擔,以及用于構建相關治理框架的推理成本占比。現(xiàn)實情況是,這個比例通常高達 1:5,甚至更高。
銀行、電信和制造業(yè)的的未來走向
AI 架構的第二次變革正在到來:亞二次復雜度注意力機制(Sub-Quadratic Attention)。來自DeepSeek、Google 與 Cartesia 的新方案,正在以數(shù)量級降低長上下文推理的成本。最近的基準測試顯示,在保持一定精度的情況下,成本可降低 100 至 300 倍。
對于大型銀行而言,這一變革意味著全資產(chǎn)組合風險建模、跨數(shù)十年的欺詐模式識別,以及跨司法轄區(qū)的 KYC(了解你的客戶)流程,都可以從過去依賴分塊檢索(Chunked Retrieval)的方式,轉(zhuǎn)變?yōu)橐淮涡酝评硗瓿伞?/p>
對于電信運營商而言,智能體驅(qū)動的網(wǎng)絡運維、預測性維護以及跨年度的客戶旅程分析,在規(guī)模化實施時將在成本上更具備可行性。
對于制造企業(yè)而言,全工廠仿真和供應鏈中斷預測也正從周期性批處理任務轉(zhuǎn)變?yōu)槌掷m(xù)性推理。
最終勝出的架構,不會是 token 價格最便宜的,而是能夠?qū)⑺懔Σ渴鹪谧羁拷鼣?shù)據(jù)的位置、運行在正確司法轄區(qū)之下并具備治理能力的架構。可持續(xù)、主權、可控將成為 AI 時代的三個新標準。而圍繞這些標準構建 AI 能力的企業(yè),將定義未來十年的競爭格局。

