当AI学会协作:新一代Agent产品的范式革命
五月还未结束,AI agent领域的战争已经进入白热化阶段。Grok Build、Qoder 1.0、TRAE SOLO等新一代产品如排山倒海般涌向市场,而Claude Code、Codex、Cursor早已贴身肉搏多时。
整个行业的加速快到不讲道理。Vibe Coding从新名词到行业标配,仅仅用了一个季度。从去年还在讨论skill(技能)如何构建,到如今harness(脚手架)成为新的王座,这场技术演进的步伐已经超越了大多数人的预期。
模型能力趋平:98.4%的工程奇迹
模型之间仍然存在差距,但拉开模型公司之间真正差距的,早已不再是模型本身,而是套在外面的那层壳。一份近期研究报告拆解了Claude Code泄露的代码,发现真正属于模型决策的代码只有1.6%,剩下98.4%,全是管权限、管上下文、兜错的harness。
这个数据揭示了一个残酷的现实:在基准测试中,无论是Opus、GPT,还是Qwen、GLM、Kimi和MiniMax们,无论是写代码还是执行越来越复杂的任务,都已不在话下。模型能力已经卷到几近一条平直的线,不同测试会给出不同答案,但总体来说,大家都站在同一起跑线上。
真正的战场转移到了工程领域。为了进一步发挥模型的优势,全新一代的agent产品纷纷推出,它们不仅仅是工具的简单包装,而是对AI工作方式的重新定义。
多agent编排:从单打独斗到团队作战
MiniMax在5月中旬推出的Agent Team功能,展示了多agent编排的最新思路。这套Leader-Worker-Verifier(领导-执行-验证)的「对抗式」架构,代表了agent工程的一种新范式。
核心思想很简单:让干活的和负责验证的agent之间分开,验证的时候要有打回的机制,并且要让一个新的「脑子」去打回。这种设计的目的是解决长程agent任务中的顽疾:上下文污染、上下文焦虑、agent之间的「共谋」。
当agent数量从一个变成多个,从简单的顺序执行变成复杂的协作关系,整个系统的复杂度呈指数级增长。但随之而来的是效率的质的飞跃。
正如MiniMax的工程师择因所说:「比如你睡觉前给它派个任务,哪怕是极度复杂的工作,只要你卡控的够严格,你的准出标准可量化、可观测,而不是模型自己觉得可以就可以了——只要你做好这些门禁,这群worker和verifier就能在你睡觉的时候一直跑,睡醒之后就干完了。」
信任与约束:两种截然不同的哲学
业界目前形成了两种截然不同的agent设计哲学。Anthropic的代表性思路是不信任模型,预设模型会作弊、耍小聪明,于是到处加以约束。OpenAI的harness核心却是一个极简的agentic loop。
择因对此分析道:「一个极简的agent框架,驭遵循度极好的GPT 5.5,实现目前最强的编码和agent能力;层层约束的框架,用在Opus 4.7上,却出现了黑天鹅效应,在超长任务中也会偷懒糊弄,这是我所看到的。」
这种哲学分歧背后,是对AI本质理解的差异。是把AI当作需要严加管控的「风险源」,还是当作可以赋予更多自主性的「伙伴」,这不仅是技术选择,更是世界观的选择。
上下文隔离:反直觉的设计突破
MiniMax Code的一大特点是agent之间上下文隔离,这一设计看似反直觉,却是应对长程任务的关键突破。
agent的上下文分为三部分:用户请求、环境里的生产资料、模型执行轨迹。当agent执行出了错,会把犯的错记下来,但这个记录对另一个agent可能是有害的。当上下文变得臃肿,这些轨迹一定会污染别的agent。
择因解释道:「长程agent任务跑出几个小时后,几乎全部的上下文都是执行轨迹,所以我们要隔离这一部分上下文。做这个设计就是因为我们预期agent会运行很久,既然大部分的信息都是不需要的,为什么不隔离?」
没有壁垒,全是共识
一个有趣的现象是,在agent领域,共识形成的速度越来越快。Skill用了半年成为共识,Lobster(龙虾)只用了一个半月,而多agent编排更是仅用一个月就成为行业标配。
择因坦言:「大家越来越重视agent,并且形成共识的速度会越来越快。前几天有篇华人团队发的71页论文写得非常好。关于agent的一切,其实都在这篇论文里了,叫做Agent Harness Engineering: a Survey——既然agent已经能被一篇论文所概括了,你说有没有壁垒?」
这种快速共识的形成,一方面得益于开源文化和知识的快速流动,另一方面也反映了这个领域还处于早期阶段,大家还在探索最佳实践。
中国模型公司的「开源」博弈
中国模型公司的「开源」玩法不会一直持续下去。但这并不代表,优秀的认知不应该及时与世界分享。当模型能力足够强大时,是否开源取决于团队的偏好与意志。
择因指出:「过去两年里中国模型刚起步的时候,作为追随者,开源的确能够更好地体现价值。很多同行都公开或私底下表达过,如果有一天模型进入价格战阶段,到时候开源的风气可能会有所消减。」
全球来看,开源仍是中美之间的最大区别。即便今后权重、训练框架不开源,仍然可以把创新成果通过论文开放给全世界,不一定非得是模型能力本身。
未来展望:从代码世界到物理世界
当被问及距离《Her》中的萨曼莎、钢铁侠的贾维斯还有多远时,择因给出了乐观的答案:「我觉得其实不远。《Her》是聊天陪伴为主,现在做的已经不错了;贾维斯的话,其实和现实世界连接更加紧密。这会有点难,但我很乐观,因为我觉得物理世界的交互协议会比代码层面更加简单。」
本质上,只要模型的多模态能力足够强就可以。GPT Image 2已经展示了极强的生图能力,几乎和现实世界一模一样。可以预见的是,会有一款全模态模型出现,对现实世界的理解能力达到新高度。
人类的新角色:从执行者到设计者
随着agent能力不断提升,人类的工作范式正在发生根本性转变。择因分享了自己的观察:「从过去迫使模型、agent和我们一起干活,变成我们可以更多深度思考我们的工作,对工作进行抽象和模式识别,形成skill和规范——每一个人都变成了更加senior的工作者。」
这种转变带来了一个有趣的推论:未来大学本科生毕业之后,可能要「付费再上两到三年班」,成为一个资深员工之后,才能开始上班赚钱。
择因解释道:「如果agent的能力真的全面赶超人类,聪明的公司算笔账都不会再招初级员工,这才是最可怕的。到那时候,你要先成为资深员工,而这个过程可能需要自己付费。」
这并非危言耸听。在某些领域,如视频剪辑,这种情况已经发生。剪辑师的价格比AI便宜,一些服务商甚至找大学生上课学剪辑,交学费,课程任务就是帮忙剪辑视频。
结语:山雨欲来
新一代agent产品的集中涌现,标志着AI从工具时代向协同时代迈出了关键一步。当AI学会协作,当多个agent能够像团队一样工作,整个社会的生产效率将迎来新的飞跃。
但在这个过程中,我们需要保持理性思考。共识形成过快可能导致盲从,技术迭代加速可能掩盖了深层次的问题。正如择因所说:「在agent时代,大家开发效率很高、迭代很快,但是决定胜负手的还是所有的细节。模型变快了,但我们得慢下来去知道所有的信息。」
距离那个AI能够完全自主协作、无缝连接物理世界的未来,我们或许真的不远了。但更重要的是,在这个过程中,人类如何重新定义自己的角色,如何在效率与人性之间找到新的平衡点。
山雨欲来,但我们需要的不仅是迎接这场雨,更要思考雨后会出现怎样的新世界。
特别声明:产联社摘录或转载的属于第三方的信息,目的在于传递更多信息而非盈利,同时并不代表赞成其观点或证实其描述,内容仅供参考。转载信息版权归原媒体及作者所有,若有侵权,请联系我们删除。如其他媒体、网站或个人擅自转载使用,请自负版权等法律责任。



