亲历 AI 提效的真实混乱:一个 PR 改了 50 万行代码、产研关系差点崩了

亲历 AI 提效的真实混乱:一个 PR 改了 50 万行代码、产研关系差点崩了

作者 | 唐小引
出品 | CSDN(ID:CSDNnews)

核心事件: YouMind 联合创始人兼 CTO 双扬(杨森)在 2026 奇点智能产品大会上,分享其团队在过去一年中因全面拥抱 AI Coding 而经历的工程与管理混乱。


效率提升背后的“虚假繁荣”

一家成立于 2024 年的 To C AI SaaS 公司 YouMind,自成立第一天起便全面拥抱 AI Coding(从 GitHub Copilot 起步)。CTO 双扬指出,相比前 AI Coding 时代,团队效率提升了百倍;但在最近一年,这种提升约为 2-3 倍。

效率的提升带来了两个显著现象:
1. 交付成本降低: 产品经理提出想法后,工程师可在 30 分钟至 1 小时内通过 AI 生成 Demo 进行验证,讨论成本大幅降低。
2. 角色边界模糊: 在人员不足时,工程师可直接交付产品(如仅用一周时间独立开发上线移动端应用),甚至出现工程师“越俎代庖”直接交付 Idea 的情况。

然而,这种看似美好的高效背后,隐藏着研发内部协作断裂和产研信任危机的隐患。


困境一:50 万行代码变更与协作率下降

随着 AI 辅助编程的深入,YouMind 的代码库发生了结构性变化:
* 代码规模: 有效代码超过 100 万行。
* 极端案例: 曾出现一个 PR 包含 50 万行代码变更,由一名工程师独立完成且无法进行 Code Review。
* 协作指标恶化:
* 很少有人同时编辑同一个文件,大家倾向于新开模块而非复用现有代码。
* 增删比上升: 从每增加 1.8 行代码删除 1 行,变为每增加 3 行才删除 1 行。这表明代码整洁度下降,无效 Context 堆积,容易撑爆 Agent 的上下文窗口。


困境二:静默的性能退化与 System Prompt 矛盾

今年 5 月,YouMind 的 Eval 评分系统显示 Agent 表现缓慢降低,用户反馈 PPT 或文档生成偶尔出错。排查过程如下:
* 日志无报错: 代码无 Crash,模型参数未变更。
* 原因定位: 双扬召集工程师关闭电脑,共同阅读最终生成的 System Prompt 和 Tool Description。
* 根本原因: System Prompt 是模块化拼接的(主角色定义、工具、安全隔离等)。不同模块单独看合理,但拼接后出现矛盾描述(如某处允许编辑文件,另一处禁止),导致 Agent 行为偏离。

这揭示了 AI 时代的新风险:在 Context Window 限制下,Coding Agent 难以进行全局冗余检查,单人解决的“局部最优”可能导致“全局冲突”。


困境三:产研信任危机与“AI 对喷”

产研协作流程的改变引发了新的沟通障碍:
1. AI 回复的不可信性: 产品经理在 Linear 提 Issue,工程师让 Claude Code 调研后回复万字长文。由于无法区分哪些是工程师的判断,哪些是 AI 的输出,导致沟通失效。甚至出现工程师承认“我没细看,是我的 AI 写的”情况,严重削弱信任。
2. 讨论热度下降: 数据显示,当团队成员过度依赖 AI 回复时,Issue 讨论活跃度急剧下降,形成“AI 对 AI”的无效交流。
3. 设计还原差距: Coding Agent 难以精确还原复杂的设计稿(如阴影、过渡效果),导致工程师与设计师之间产生矛盾。


解法:该快的地方飞,该慢的地方拉紧

针对上述问题,YouMind 采取了一系列管理和技术措施:

1. 建立分级 Harness 机制

  • 快速迭代区: 影响面小、不易出错的模块,允许工程师 Solo 快速迭代。
  • 强管控区: 核心模块(登录鉴权、订阅注册、安全问题等),必须设置 Code Owners,需指定人员 Review 并通过才能合入主干。

2. 规范 AI 辅助沟通

要求使用 AI 起草 Linear 或 IM 回复时,必须在开头手动撰写 TL;DR(Too Long; Didn't Read),明确标注哪些是个人的判断,哪些是 AI 生成的内容,以恢复人与人之间的信任。

3. 设计师介入代码层

为产品设计师开通 Codex 和 Claude Code 席位,教授其直接修改代码。对于设计还原度问题,由设计师直接口述修改并提 PR,工程师仅负责审查潜在逻辑问题,从而解决视觉还原矛盾。

4. 产品经理角色转型

  • 从 UI 设计到 Skill 设计: 产品经理的工作重心从设计表单、按钮转向设计 AI 的 Skill(如拆解 PPT 创作意图)。
  • 关注 Bad Case: 产品经理深入分析 Eval 系统中的用户点踩数据,理解用户对 Agent 行为和产物不满的根本原因。

5. 强化 Human in the Loop

尽管技术上 Agent 可自我进化,但 YouMind 坚持在关键决策节点保留人工干预。双扬认为:“如果这个 loop 里没有人了,那到底谁需要 AI 呢?”人类的价值观、审美和品味是提升 AI 产品上限的关键。


运营创新:给 Agent 发工资

在 KPI 导向方面,YouMind 不强制要求 Token 用量,而是鼓励员工将专业知识 Agent 化,并为这些 Agent “发工资”(覆盖 Token 成本)。
* 案例: 一个用于 Linear Issue Triage(分诊)的 Agent,初期 Token 成本约 2000 元/月。随着模型优化和国产模型性能提升,该 Agent 的成本已低于其带来的效率收益,实现“盈利”。


质量保障:监控驱动优于代码审查

面对 AI 生成代码的不可控性,YouMind 调整了质量保障策略:
* 弱化传统 Code Review: 不再纠结代码风格,仅确保 CI 通过和类型编译无误。
* 强化线上监控: 投入大量资金构建详尽的日志和实时看板,监控 CPU、内存、报错率及业务指标波动。
* 快速回滚: 依赖 DevOps 自动化,一旦监控发现异常,立即回滚变更。

双扬总结道:“在 AI 创业公司,我们更关注的是交付质量(线上稳定性、速度与质量),而非单纯的代码质量。”


结语:实现很廉价,品味无价

随着实现成本的降低(Cheap),程序员的全链路能力增强,产品经理的价值并未消失,而是转移到了需求洞察、用户理解和审美品味上。同样一个功能,工程师可能做出工具,而懂用户的产品经理能赋予其情绪价值,使其成为成熟的商业化产品。

2026 年的 AI 原生团队,最朴素也最难做到的事,或许就是在效率狂飙的时代,知道何时该放手让 AI 飞翔,何时该拉紧缰绳让人回归。