8 月 19 日,據晚點 LatePost 報道,字節跳動 Seed 基礎模型團隊進行重大組織調整,新設四個一級部門:Pretrain Data(預訓練資料)、Horizon RL(強化學習)、Product Posttrain-Work(面向辦公場景的產品後訓練)和 Product Posttrain-Chat(面向對話場景的產品後訓練),分別由李成剛、唐晟宇、秦禹嘉、朱文佳負責,均向吳永輝彙報。雷峰網進一步瞭解到,四個新部門之下的分支架構與帶隊人選也已落定,這些更細的調整或許更能透露出此次組織變動背後的真實意圖。

在模型能力側,Pretrain Data 由原先分散在文本、程式設計、視覺理解和語音方向的預訓練資料團隊合併而來,下設文本預訓練(沈科)、程式碼預訓練(Xia Xiao)、視覺預訓練(林毅)和語音預訓練四個分支,統一為 Omni 全模態模型和超大模型供給資料。負責人李成剛是清華機械系本碩,曾從 0 到 1 搭建位元組搜尋系統,先後負責今日頭條網頁搜尋和 TikTok 影片搜尋的技術工作。其麾下沈科 2018 年從清華畢業後加入位元組,是超大模型預訓練資料的核心人物;Xia Xiao 則是開原始碼模型 Seed-Coder 和定理證明搜尋方法 BFS-prover 的核心作者之一。

相比資料條線,Horizon RL 的動作更大。它整合了分散在推理、視覺理解等方向的後訓練團隊,下設 RL Scaling(嶽宇)、Reasoning(王明軒)和視覺強化學習(吳侑彬)三個分支,負責強化學習、提升模型的基礎智慧上限。王明軒此前在火山翻譯,北航本科、中科院計算所博士,曾在騰訊任高階研究員、多次拿下 WMT 機器翻譯評測冠軍,2019 年加入位元組後一路做到大模型研究團隊負責人;嶽宇則是位元組與清華 AIR 聯合開源的強化學習系統 DAPO 的演算法作者之一。Seed 此前已公開過 DAPO、VAPO 等強化學習工作,其中 VAPO 聚焦於推理模型的強化學習效率與穩定性,並持續將 RL 用於更長鏈路的推理和 Agent 能力。

把這幾個人和三個方向放在一起,Horizon RL 的意圖比較清楚:它並非簡單把原來的“後訓練團隊”換名,而是將 Reasoning、VLM 等不同方向中的 RL 能力進一步集中。據晚點 LatePost 報道,Seed 在調整公告中稱,此次調整旨在“合併相似工作、減少 overlap,內聚在一起”。有接近位元組的人士告訴雷峰網,調整後文本、程式碼、視覺等老方向並未消失,只是換了管法。以視覺為例:訓練前的資料歸 Pretrain Data 的林毅,訓練後的強化學習歸 Horizon RL 的吳侑彬,兩人各屬一個部門、互不隸屬,但視覺的資料和強化學習本是一根鏈條,因此吳侑彬在視覺方向上還需同時向林毅彙報。類似的安排還有兩處:唐晟宇在執掌 Horizon RL 之外,同時管著程式碼預訓練;此前主導多模態互動與世界模型的周暢同時管著視覺預訓練。

在產品側,原先統一的應用後訓練團隊按使用者任務一分為二。Product Posttrain-Work 服務 B 端,下設 GUI(吳志勇)和由原有 Agent 辦公團隊合併而來的分支,負責 Agentic 模型的整合與釋出,針對辦公場景最佳化模型的 Agentic 能力,包括支援豆包和 Dola 的任務模式。負責人秦禹嘉是四個新部門負責人中的 90 後,師從清華教授劉知遠,曾是面壁智慧核心成員、開源工具學習引擎 BMTools 的作者,2024 年 7 月才通過 Top Seed 人才計劃加入位元組,是 GUI 智慧體 UI-TARS 的第一作者,兩年升至一級部門負責人。GUI 分支負責人吳志勇,公開資訊顯示其曾參與 OS-Atlas、SeeClick 等 GUI 智慧體開源工作。

原本由朱文佳負責的 Application 團隊繼續保留,並更名為 Product Posttrain-Chat,它與新成立的 Product Posttrain-Work 分別面向 C 端對話和辦公任務,下設豆包和 Dola Chat 分支,負責人嚴林同時吸收了吳雙志的原班人馬,主要最佳化搜尋問答、對話體驗、個性化和安全等能力,同時控制推理成本。嚴林是中科院計算所碩士,豆包大語言模型 Alignment 團隊負責人,在公開資訊中還擔任豆包關聯公司的法定代表人。有知情人士稱,吳雙志則轉往火山引擎,負責火山 API 支援,向吳迪彙報——吳迪同時掌管位元組機器學習中台和火山引擎的演算法團隊。

一拆一合的邏輯背後,反映出一個趨勢:過去大模型產品更多按模型能力來分,比如語言、視覺、程式碼;現在則更多按使用者要做什麼來分。Chat 面向搜尋、問答、對話等 C 端需求,Work 則更多面向辦公場景和複雜任務,等於把 AI Coding 中已積累的工具呼叫、電腦操作和複雜任務執行能力,進一步用到日常辦公中。從人員安排看,Work 交給更熟悉 Agent 的年輕團隊,Chat 由在位元組內部成長起來的嚴林負責,吳雙志這樣的後訓練人才則更多流向火山。接近位元組的內部人士稱,位元組現在的定位看似已清晰:豆包、Dola 負責短期做大使用者規模;Work 押注新的 Agent 辦公場景;火山則承擔更長期的企業服務和模型商業化。

放到行業裡,Seed 的這輪調整並不孤立。騰訊上月將混元的大語言模型部與多模態模型部合併為基礎模型部,由姚順雨統一負責;海外 Meta 的超級智慧實驗室也按模型、研究、產品、Infra 四塊重組。可以看到,模型向 Omni 發展後,不同模態之間的邊界變得模糊;Reasoning 和 Agent 成為競爭重點後,RL 也不再只是某個模型的“後訓練環節”。而 Agent 也在拉近模型和產品之間的距離,模型不僅要“理解和生成”,還要呼叫工具、執行任務,最終直接參與到產品和業務流程中。本次 Seed 調整得更徹底:它換掉的是整套組織邏輯——不再按文本、程式碼、視覺各自為戰,而是把這些能力打散,重新裝進資料、強化學習和產品任務裡。框架已經搭起來了,接下來要看的,是這套組織方式能否真正跑通。