据晚点LatePost 8月19日报道,字节跳动Seed基础模型团队完成一项组织架构调整,新设Pretrain Data、Horizon RL、Product Posttrain-Work和Product Posttrain-Chat四个一级部门,分别聚焦预训练数据、强化学习、办公场景产品后训练和对话场景产品后训练,负责人为李成刚、唐晟宇、秦禹嘉和朱文佳,均向吴永辉汇报。雷峰网了解到,新部门之下的分支架构和带队人选也已落定,原有文本、代码、视觉等方向被打散,重新装进数据、强化学习和产品任务等序列。

具体看,Pretrain Data由原先分散在文本、编程、视觉理解和语音方向的预训练数据团队合并而来,统一为Omni全模态模型和超大模型供给数据,下设文本预训练、代码预训练、视觉预训练和语音预训练四个分支。Horizon RL整合了此前分散在推理、视觉理解等方向的后训练团队,下设RL Scaling、Reasoning和视觉强化学习三个分支,负责强化学习以及模型基础智能上限的提升。据晚点LatePost报道,Seed在调整公告中称,此次调整旨在“合并相似工作、减少overlap,内聚在一起”。

有接近字节的人士向雷峰网表示,文本、代码、视觉这些老方向并未消失,只是改变了管理方式。以视觉为例,预训练数据归入Pretrain Data下的林毅团队,强化学习归入Horizon RL下的吴侑彬团队,因视觉数据和强化学习处于同一条技术链条,吴侑彬在视觉方向上还要向林毅汇报。类似的安排还有,唐晟宇在执掌Horizon RL的同时管理代码预训练,此前主导多模态交互与世界模型的周畅同时管理视觉预训练。

产品侧,原先统一的应用后训练团队按用户任务拆分为两条线。Product Posttrain-Work面向B端办公场景,下设GUI分支和由原有Agent办公团队整合来的分支,负责Agentic模型的整合与发布,由秦禹嘉负责。Product Posttrain-Chat由原Application团队更名而来,面向C端搜索问答与对话体验,继续由朱文佳负责,其下的豆包和Dola Chat分支由严林负责,严林吸收了吴双志的原班人马。有知情人士称,吴双志转往火山引擎,负责火山API支持,向吴迪汇报。

这轮调整放在行业背景中并不孤立。腾讯上月将混元大语言模型部与多模态模型部合并为基础模型部,由姚顺雨统一负责;Meta的超级智能实验室也按模型、研究、产品、Infra四块重组。大模型向全模态发展后,不同模态边界变得模糊;强化学习与Agent成为竞争重点后,模型产品更多按用户任务而非模态来组织。字节此番直接把数据、强化学习和产品任务设置为一级部门,等于将原模态团队拆散重组。新架构能否按预期跑通,还有待后续验证。