LATEPOST × INTERACTIVE CASE
ORG REBOOT
300
混元重启
一间组织手术室
一个 28 岁的新负责人,用 300 天诊断漏水系统、重画组织、重构 Infra——然后把模型重新带回真实业务。
- SOURCE / 原文
- 晚点 LatePost
- DATE / 发布
- 2026.07.13
- SUBJECT / 对象
- 腾讯混元
- FORM / 形态
- 互动组织病例
OPERATION ROOM / HUNYUANREBUILDING
DIAGNOSE◆REWIRE◆INFRA◆DATA◆CO-DESIGN
2,0002023 年立项时从广告部门匀来的 GPU
95%标注验收线;实际长期约 60%—70%
295BHy3 总参数量;推理激活 21B
3.66TPreview 单周 Token;环比增长 298%
数字均据原文报道,其中部分来自匿名信源、内部口径或第三方平台,不等同于腾讯官方披露。
00 / THE THESIS
这不是一次
模型换代。
原文真正讲的不是“天才空降”,而是一个大公司如何暂时切断组织惯性:先允许一个人诊断系统,再让他重组人才、Infra 与数据,最后尝试把模型和产品重新绑在一起。
Hy3 是第一张成绩单,却不是终点。修船、换人、清数据属于“守正”;模型能否形成独特价值、腾讯能否跨部门协同,才是尚未完成的“出奇”。
核心矛盾:一个人可以改变一支团队的速度,却很难独自改变一家公司的惯性。
01 / 300-DAY LOG
四个阶段,
把船重新浮起。
点击阶段查看这次改造的目标、动作与阶段性结果。天数是依据报道时间线做的叙事标记,不是精确项目工期。
PHASE 01 / DIAGNOSE
几乎每个环节都在漏水
以顾问身份逐环节排查:评测语料污染训练集,数据团队各自为营,Infra 无法支撑大规模稳定训练,产品部门也感到模型目标与真实需求割裂。
02 / SYSTEM SCAN
漏水的不是一处,
是四套系统。
点击左侧切换诊断。每一个“症状”背后都不是单点技术问题,而是目标、组织与基础设施的错位。
SYSTEM 01 / BENCHMARK
模型很会答,真实场景却不好用
团队过度追逐榜单,把部分打榜语料放进训练集,结果是评测被污染、反馈回路失真。
SYMPTOM / 症状排行榜看起来进步,业务调用仍频繁暴露问题。
ROOT CAUSE / 根因“向上汇报”替代了“解决真实任务”,评测失去诊断意义。
RESET / 重置丢弃传统榜单评测基准,重新定义数据标准,并请求总办至少一年不看榜单。
03 / ORG REWIRE
不是裁一遍人,
而是重画连接。
四个视角还原组织重构:权力从哪里来、层级如何缩短、算法与 Infra 如何同桌、研究如何回到真问题。
姚顺雨DECISION OWNER
预训练DIRECTION LEAD
后训练DIRECTION LEAD
AI InfraDIRECTION LEAD
研究员研究员实习生实习生
VIEW 01 / FLAT TREE
把路径缩到三层
部门层级被简化为“姚顺雨—方向负责人—研究员/实习生”。一线问题可以进入百人大群,负责人也直接和最底层节点交流。
- 任何问题都能快速进入共享信息面
- 方向负责人对结果负责,而不是只做协调
- 实习生也可以直接反馈工具和流程问题
04 / NO MAGIC
没有魔法。
先把常识做对。
“守正”并不保守:它意味着先定义用户真实任务和可承受成本,再决定模型规模、架构与数据,而不是追逐每一个看起来很酷的技术方向。
01 / INFRA重构基础设施
花两个月重构预训练与强化学习 Infra,把训练稳定性、算力利用率和迭代速度放到台前。
算法与 Infra
在定版前同桌
02 / DATA清洗而非堆量
沿用既有数据,但从头清洗;SFT 数据大幅去重和筛选,最终只保留一万余条。
少而真
胜过多而脏
03 / TARGET先定义真实任务
目标不是在所有能力上击败最前沿模型,而是在多数日常任务上,以更低成本提供足够好的体验。
90% 日常问题
× 1% 价格设想
04 / SCALE克制参数规模
Hy3 采用标准 MoE Transformer:总参数 295B、每次推理激活 21B,优先压低推理成本。
规模服务目标
不是反过来
GOOD MODEL=清楚的目标×可靠的数据×稳定的 Infra×真实反馈
05 / OUT OF THE LAB
模型要走出混元,
进入真实业务。
Co-design 试图把“通用模型交付给产品”改成“模型与产品从第一天联合开发”。这既是腾讯最独特的资源,也可能是最难打破的部门墙。
真实任务
REAL TASKS
用户反馈
FEEDBACK
后训练
POST-TRAIN
产品迭代
ITERATION
MODEL
×
PRODUCT
CO-DESIGN / FLYWHEEL
好问题,才是下一种稀缺资源。
报道中,姚顺雨选择腾讯的理由之一,是腾讯与 Meta 一样沉淀了大量业务上下文。模型可以从社交、办公、文档、游戏、客服等真实问题中找到优化方向。
元宝 / 交叉派驻混元派后训练团队驻场,建立联合设计、代码审查和共享机制。
WorkBuddy / 反馈回流模型针对产品脚手架适配,产品使用反馈再回到训练环节。
全公司 RL 平台 / 尚待验证业务训练自己的模型,同时向混元回流训练数据,形成公司级循环。
06 / THE REAL TEST
容易的事情做完了。
接下来,压力来自公司本身。
RISK 01资源会重新分叉
GPU 和资金都不是无限子弹。混元追求智能上限,微信寻找更经济的算力模式;当路线并存,分配机制将持续受考验。
RISK 02成功会增加决策者
产品一旦受到高层重视,参与决策的人往往变多。意见密度上升,单一负责人的拍板空间可能被逐步压缩。
RISK 03Co-design 天然不同步
产品需要本周上线,模型团队更关心下个大版本。节奏与目标无法完全贴合,联合设计也可能退化成新的协同流程。
FINAL
DIAGNOSIS
改革走到最深处,考验的已经不只是姚顺雨,而是总办能否持续替改革留出决策空间,以及双方的信任与意志能否继续统一。