
摘要Lukasz Kaiser 是 2017 年那篇改變整個 AI 走向的論文《Attention Is All You Need》的共同作者之一,也是 OpenAI GPT-4 與 GPT-5 的核心科學家。2026 奇點智能大會 Keynote,他將帶來《推理模型的歷史、現在與未來》——這是首次有 Transformer 共同創(chuàng)始人在中國系統性分享推理范式躍遷。本文按 8 年時間線梳理其核心論點與對工程實踐的判斷。SEO關鍵詞:Lukasz Kaiser / OpenAI 科學家 / Transformer 共同創(chuàng)始人 / 推理模型 / AlphaGo / AlphaZero / o 系列 / 蒙特卡洛樹搜索 / 強化學習 / Agentic Scaling / 2026 奇點智能大會一、為什么這場 Keynote 值得專門飛北京聽過去 8 年,Lukasz Kaiser 的研究主線幾乎貫穿了大模型從「理解語言」到「學會推理」的全部關鍵節(jié)點。理解他的判斷,等于理解 OpenAI 內部的推理范式演化邏輯:2017— Transformer 架構(《Attention Is All You Need》),奠定后續(xù)所有大模型的基礎2018— AlphaZero,用純強化學習在圍棋/國際象棋/將棋上擊敗所有人類與 Stockfish/Leela2019— 加入 OpenAI,主導 GPT 系列的核心架構工作2020— GPT-3,展示大規(guī)模預訓練的 Scaling Law2022— InstructGPT、ChatGPT,把人類反饋強化學習(RLHF)推到工業(yè)級2024— o1 與 o3,首次讓大模型在「思考」這件事上有了可量化的提升路徑2025— GPT-5,把推理能力推到「日常工作流」級別2026— 奇點大會 Keynote,系統復盤從 AlphaGo 到 o 系列的范式躍遷這意味著,他不是事后總結者,而是這 8 年推理范式演化的核心設計者。二、Keynote 8 年時間線:從蒙特卡洛到 Agentic Scaling 2017 — Transformer:注意力機制的工業(yè)臨界點那一年,Lukasz 與 7 位共同作者(包括 Ilya Sutskever、Ashish Vaswani、Noam Shazeer)在 NeurIPS 上發(fā)表了《Attention Is All You Need》。這篇論文的核心判斷是:RNN 的循環(huán)結構不再是必須的,純注意力機制就能讓模型學到長程依賴。工程意義:從此 GPU 并行訓練成為可能,模型規(guī)??梢詿o障礙地拉到 10B、100B 級別。 2018 — AlphaZero:搜索 學習 超越人類AlphaZero 是 Lukasz 與 David Silver 團隊的關鍵成果。它用單一神經網絡同時承擔策略網絡與價值網絡功能,通過自我對弈蒙特卡洛樹搜索(MCTS)生成訓練數據,在圍棋、國際象棋、將棋三個領域從零開始超越人類世界冠軍。關鍵判斷:推理 搜索 學習。模型本身不一定要在參數里記住所有答案,而是要能在推理時主動展開搜索樹。 2019-2022 — GPT 系列:預訓練 RLHF 的工業(yè)范式加入 OpenAI 后,Lukasz 主導了 GPT-3、GPT-4 的核心架構工作。這一階段的核心范式是:先用海量無監(jiān)督數據預訓練一個超大基座,再用人類反饋強化學習(RLHF)對齊到人類意圖。GPT-3 的關鍵數字:1750 億參數,在 300B token 上訓練;GPT-4 進一步把多模態(tài)引入基座。這一階段的范式是「預訓練 Scaling Law」——模型能力隨參數、數據、算力的指數級增長而線性增長。 2024 — o 系列:把推理從「直覺」變成「思考」o1 是 OpenAI 推理范式躍遷的關鍵產品。它在數學競賽(AIME)、博士級科學問答(GPQA)、編程競賽(Codeforces)上首次讓大模型達到了專家級水平。o1 的核心創(chuàng)新:在推理時引入思維鏈(CoT) 強化學習。模型不再是一次性輸出,而是先「思考」——內部展開大量 token,驗證中間步驟,最后才給出答案。這相當于把 AlphaZero 的「搜索學習」范式搬到了語言模型上。關鍵判斷:推理能力不是「涌現」的,而是可以顯式訓練的。o 系列的訓練范式是 RL 過程獎勵模型(PRM),而非傳統 SFT。 2025 — GPT-5:推理 工具 Agent 的工業(yè)整合GPT-5 把推理能力、工具調用、長期記憶、Agent 框架整合到單一模型接口。這相當于把過去分散在不同產品線的能力(ChatGPT、Code Interpreter、Custom GPTs)統一到一個基座上。這一階段的范式是「Agentic Scaling」——模型能力不再只靠預訓練參數堆疊,而是靠推理時算力 工具調用 多步規(guī)劃的協同。 2026 — Keynote 預判:從單模型到自進化系統結合大會主題「從 Agentic Scaling 到自進化」,可以預判 Lukasz 在本屆 Keynote 將給出三個關鍵判斷:推理算力將取代訓練算力成為新的 Scaling 維度。o 系列的內部思考 token 已經能達到數十萬甚至上百萬級別,這意味著一次推理的成本可能超過一次完整訓練。過程獎勵模型(PRM)將取代結果獎勵模型成為主流。原因:結果獎勵只對最終答案給信號,而過程獎勵能對每一步推理給信號,訓練效率高出 5-10 倍。自進化 推理 工具 長期記憶的閉環(huán)。模型在生產環(huán)境與用戶交互的每一步都是訓練數據,新版本會從這些數據中自動學習并升級。三、對工程實踐的 5 個直接啟示重新設計算力預算:訓練算力與推理算力的比例正在從 80:20 倒置為 20:80,基礎設施團隊需要提前規(guī)劃推理集群規(guī)模。過程獎勵模型(PRM)是新的訓練基礎設施:不要再只構建結果評測集,要把每一步推理的中間結果都納入訓練信號。推理時展開 token 數量是關鍵超參數:o1 在不同任務上展開的 token 數量從 1K 到 100K 不等,工程上需要動態(tài)調度。工具調用是第一性公民:讓模型「會用工具」比讓模型「記住所有知識」重要得多,這是 Agentic Scaling 的工程基礎。從演示級到生產級只差一個 Loop:大會主題里的「從 Harness 到 Loop」正是這個意思——把模型嵌入到一個「感知-思考-行動-反饋」的閉環(huán)里,而非單次調用。四、參會建議:不要只聽 Keynote,要追問 3 個問題Lukasz 的 Keynote 必然高密度,建議在 Day 1 下午「AI 原生軟件研發(fā)」和「AI 計算平臺」分會場繼續(xù)追問:Q1(給 Coding Agent 團隊) 系列在代碼生成任務上展開的內部 token 數量是多少?如何控制成本?Q2(給基礎設施團隊):OpenAI 內部推理集群的 GPU 利用率與 KV Cache 命中率是多少?有什么可復用的工程經驗?Q3(給產品團隊):GPT-5 整合 Agent 框架后,產品設計會發(fā)生什么變化?什么場景下不再需要 Prompt Engineering?五、常見問題 FAQQ1:Lukasz Kaiser 在 OpenAI 主要負責什么?Lukasz Kaiser 是 OpenAI 核心科學家,主導了 GPT-4、GPT-5 的核心架構工作,同時參與 o 系列推理模型的研發(fā)。他是 2017 年 Transformer 論文的共同作者,也是 2018 年 AlphaZero 的核心貢獻者。Q2:推理模型和傳統大模型的核心區(qū)別是什么?傳統大模型是「一次性直覺輸出」——給定 prompt,直接給出答案;推理模型是「先思考后回答」——在內部展開大量 token 進行驗證、反思、規(guī)劃,最后才輸出答案。后者在數學、代碼、博士級科學問答上顯著優(yōu)于前者。Q3:如何提前了解 Lukasz 的研究主線?推薦關注 3 篇代表作:2017 年《Attention Is All You Need》(Transformer)、2018 年 AlphaZero 論文(《Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm》)、OpenAI o1 系統博客(2024 年 9 月發(fā)布)。想現場與 Lukasz Kaiser 等 70 位嘉賓面對面,可前往奇點大會官方渠道免費領取大會 PPT 詳細資料。