LATEPOST × INTERACTIVE CASE ORG REBOOT

300 混元重启 一间组织手术室

一个 28 岁的新负责人,用 300 天诊断漏水系统、重画组织、重构 Infra——然后把模型重新带回真实业务。

阅读原文
SOURCE / 原文
晚点 LatePost
DATE / 发布
2026.07.13
SUBJECT / 对象
腾讯混元
FORM / 形态
互动组织病例
OPERATION ROOM / HUNYUANREBUILDING
混元 300 天组织手术室专题封面
2,0002023 年立项时从广告部门匀来的 GPU
95%标注验收线;实际长期约 60%—70%
295BHy3 总参数量;推理激活 21B
3.66TPreview 单周 Token;环比增长 298%

数字均据原文报道,其中部分来自匿名信源、内部口径或第三方平台,不等同于腾讯官方披露。

00 / THE THESIS

这不是一次
模型换代。

原文真正讲的不是“天才空降”,而是一个大公司如何暂时切断组织惯性:先允许一个人诊断系统,再让他重组人才、Infra 与数据,最后尝试把模型和产品重新绑在一起。

Hy3 是第一张成绩单,却不是终点。修船、换人、清数据属于“守正”;模型能否形成独特价值、腾讯能否跨部门协同,才是尚未完成的“出奇”。

核心矛盾:一个人可以改变一支团队的速度,却很难独自改变一家公司的惯性。
01 / 300-DAY LOG

四个阶段,
把船重新浮起。

点击阶段查看这次改造的目标、动作与阶段性结果。天数是依据报道时间线做的叙事标记,不是精确项目工期。

060DIAGNOSIS
COMPLETE
PHASE 01 / DIAGNOSE

几乎每个环节都在漏水

以顾问身份逐环节排查:评测语料污染训练集,数据团队各自为营,Infra 无法支撑大规模稳定训练,产品部门也感到模型目标与真实需求割裂。

PRIMARY MOVE访谈一线与产品,重做问题清单
PHASE OUTPUT从“模型不够强”改写为“系统性失灵”
02 / SYSTEM SCAN

漏水的不是一处,
是四套系统。

点击左侧切换诊断。每一个“症状”背后都不是单点技术问题,而是目标、组织与基础设施的错位。

SYSTEM 01 / BENCHMARK

模型很会答,真实场景却不好用

团队过度追逐榜单,把部分打榜语料放进训练集,结果是评测被污染、反馈回路失真。

SYMPTOM / 症状

排行榜看起来进步,业务调用仍频繁暴露问题。

ROOT CAUSE / 根因

“向上汇报”替代了“解决真实任务”,评测失去诊断意义。

RESET / 重置

丢弃传统榜单评测基准,重新定义数据标准,并请求总办至少一年不看榜单。

03 / ORG REWIRE

不是裁一遍人,
而是重画连接。

四个视角还原组织重构:权力从哪里来、层级如何缩短、算法与 Infra 如何同桌、研究如何回到真问题。

姚顺雨DECISION OWNER
预训练DIRECTION LEAD
后训练DIRECTION LEAD
AI InfraDIRECTION LEAD
研究员研究员实习生实习生
VIEW 01 / FLAT TREE

把路径缩到三层

部门层级被简化为“姚顺雨—方向负责人—研究员/实习生”。一线问题可以进入百人大群,负责人也直接和最底层节点交流。

  1. 任何问题都能快速进入共享信息面
  2. 方向负责人对结果负责,而不是只做协调
  3. 实习生也可以直接反馈工具和流程问题
04 / NO MAGIC

没有魔法。
先把常识做对。

“守正”并不保守:它意味着先定义用户真实任务和可承受成本,再决定模型规模、架构与数据,而不是追逐每一个看起来很酷的技术方向。
01 / INFRA

重构基础设施

花两个月重构预训练与强化学习 Infra,把训练稳定性、算力利用率和迭代速度放到台前。

算法与 Infra
在定版前同桌
02 / DATA

清洗而非堆量

沿用既有数据,但从头清洗;SFT 数据大幅去重和筛选,最终只保留一万余条。

少而真
胜过多而脏
03 / TARGET

先定义真实任务

目标不是在所有能力上击败最前沿模型,而是在多数日常任务上,以更低成本提供足够好的体验。

90% 日常问题
× 1% 价格设想
04 / SCALE

克制参数规模

Hy3 采用标准 MoE Transformer:总参数 295B、每次推理激活 21B,优先压低推理成本。

规模服务目标
不是反过来
GOOD MODEL=清楚的目标×可靠的数据×稳定的 Infra×真实反馈
05 / OUT OF THE LAB

模型要走出混元,
进入真实业务。

Co-design 试图把“通用模型交付给产品”改成“模型与产品从第一天联合开发”。这既是腾讯最独特的资源,也可能是最难打破的部门墙。

CO-DESIGN / FLYWHEEL

好问题,才是下一种稀缺资源。

报道中,姚顺雨选择腾讯的理由之一,是腾讯与 Meta 一样沉淀了大量业务上下文。模型可以从社交、办公、文档、游戏、客服等真实问题中找到优化方向。

元宝 / 交叉派驻混元派后训练团队驻场,建立联合设计、代码审查和共享机制。
WorkBuddy / 反馈回流模型针对产品脚手架适配,产品使用反馈再回到训练环节。
全公司 RL 平台 / 尚待验证业务训练自己的模型,同时向混元回流训练数据,形成公司级循环。
06 / THE REAL TEST

容易的事情做完了。
接下来,压力来自公司本身。

RISK 01

资源会重新分叉

GPU 和资金都不是无限子弹。混元追求智能上限,微信寻找更经济的算力模式;当路线并存,分配机制将持续受考验。

RISK 02

成功会增加决策者

产品一旦受到高层重视,参与决策的人往往变多。意见密度上升,单一负责人的拍板空间可能被逐步压缩。

RISK 03

Co-design 天然不同步

产品需要本周上线,模型团队更关心下个大版本。节奏与目标无法完全贴合,联合设计也可能退化成新的协同流程。

FINAL
DIAGNOSIS

改革走到最深处,考验的已经不只是姚顺雨,而是总办能否持续替改革留出决策空间,以及双方的信任与意志能否继续统一。