280美元一小时的代码审查:Anthropic正用天价购买"工程直觉"

https://assets.wanlianyida.com/industry-uniapp/web/static/image-default.BtYt8t8Z.png
具身材料观察
·阅读量:3,783

当普通人还在为ChatGPT能否替代程序员争论不休时,AI巨头们早已超越了代码生成这个初级阶段。一场争夺真实"工程直觉"的战役,正在全球最聪明的AI公司间悄然打响。

一、Anthropic的天价生意:280美元一小时买什么?

最近,一篇报道揭开了Claude Code的"进步秘笈"——Anthropic正在通过约1000名软件工程师的反馈来打磨它的代码生成能力。这个名为"Marlin"的项目,每个任务报酬280美元,大约耗时一小时。有些任务甚至需要与审核层来回好几轮。

这280美元买的是什么?不是代码,而是资深程序员头脑中那个如何把代码写得更安全、更干净的判断。

让我们看看这些工程师在做什么:他们从一份包含数千个仓库的清单里,选一个GitHub代码仓库,建一个PR,再写一段提示词。模型会生成两套代码,工程师们要做的是A/B测试:比较两套输出,选出更好的那一套。

评判标准是生产级代码的正确性、安全性、可靠性和可维护性。在一个任务里,工程师让模型重构系统处理执行元数据的方式,目标是让代码更清晰、更好维护,但不改变功能。另一个任务中,工程师给MLflow这个开源机器学习平台做安全修复,针对它加载模型时下载Python包可能出现的命令注入漏洞。

这些要求已经超出了传统数据标注的范畴,它更像是要让一个资深工程师,把脑子里那套"这样写更好"的判断原样拷给模型。

真正的护城河,不再是算法或算力,而是人的品味和判断。

二、为什么非得是工程师?从写代码到改工程的本质升级

Anthropic为什么要如此大费周章?因为Claude Code早已不是一个写代码的聊天框了。

Anthropic官方把它定义为项目级的AI智能体。它能读完整个代码库,跨文件做规划,直接执行修改,跑测试,再根据失败的结果自己迭代。

这意味着它会真的动手改文件、跑任务,接触整个代码工程。当一个AI能跑命令、能动线上代码,犯错的代价就完全不一样了。

训练目标也跟着变:从"写对"升级到"写得安全、可靠、可维护"。这些东西,普通的代码语料喂不出来。它过去藏在资深工程师的代码审查里,是人传人的经验。

现在,Anthropic想通过招募人类编程专家,把它变成可以购买的数据。

三、Snorkel:从"不用人"到"用最贵的人"

整件事情的真正主角是Snorkel。这家2019年从斯坦福AI Lab走出来的公司,当年要破的正是"人工标注又慢、又贵、又不稳"这个老大难。

Snorkel最初的梦想,就是尽量把人从标注里解放出来。可到了前沿模型时代,最稀缺、最值钱的又回到了人身上,只是换成了博士、医生、律师、资深工程师等专家的品味和判断。

这家靠"少用人"起家的公司,如今最赚钱的生意反倒是组织一支昂贵的专家大军去训练前沿AI,Marlin只是其中一单。

Snorkel的工作流刚好呼应了Marlin项目的需求:先定义任务、评分标准和验证器,框定"什么算好",再跑专家评审流水线,作者、多名评审、最终裁决者层层把关,全程留痕。

它还会把评估环境和数据一并搭好,让同一批任务能在不同模型版本上反复跑,得出可复现、可比较的分数。而要让分数干净可比,评分的人就不能受版本干扰。这些外部工程师不知道自己评的是哪个版本,原因就在这儿。

报价也很能说明问题:Snorkel一个公开的法律方向合同岗,每个高质量任务10到100美元;而Marlin的软件工程任务是280美元一个、约一小时,折成时薪差不多是同行的两倍半。

Snorkel招募的这些外部工程师的反馈,是真的贵。但贵得有理。

四、巨头的同质化竞争:谁掌握了过程数据,谁就赢了

不只是Anthropic在买真实工程能力。这场竞赛,几个重磅玩家都在参与,只是打法不同。

Cursor走的是产品数据这条路。它官方写明:用户开启隐私模式后,代码绝不会被它或第三方用于训练;只有关闭隐私模式,它才可能用代码库数据、提示词、编辑行为、代码片段,来改进AI功能、训练模型。

Cursor的Tab模型每天产出超过10亿个编辑字符,请求量比初版涨了约100倍。到最新的Composer 2.5,干脆主攻需要数百步操作的长周期任务。

马斯克采用的是资本绑定/收购期权的方式。今年2月,xAI并入SpaceX。4月底,SpaceX拿下了年内以600亿美元收购Cursor母公司Anysphere的权利。马斯克看中的正是Cursor手里那份全球最活跃的真实开发者行为数据。

5月25日,马斯克在X上宣布,新一代基础模型Grok V9-Medium训练完成,参数1.5T。他特意点出,这还是没加Cursor数据补训之前的成绩,加完"编程能力会强很多"。

OpenAI后来的Codex也走上了这条路。2025年发布的Codex由codex-1驱动,OpenAI称其是在真实编码任务上通过强化学习训练的,目标是写出贴近人类风格、符合PR习惯的代码,还能反复跑测试直到通过。

他们争夺的,其实是同一种东西:过程数据,只是路径各不相同。

Anthropic先有模型,缺真实开发生场的反馈,就花钱请约1000名工程师,把软件工程过程拆成可学习的数据;Cursor先有产品和真实用户行为,但相比OpenAI、Anthropic,它更缺的是通用基础模型底座和大规模训练算力;马斯克缺的也是数据,干脆试图用几百亿美元去买一个持续产生开发者行为数据的产品入口;OpenAI模型、产品两头都不缺,于是自己搭沙箱,让模型在真实编码任务里通过强化学习一遍遍试错、测试、修正、迭代。

几家打法不同,殊途同归,都在用越来越接近真实工程现场的数据,来训练自己的AI编程模型。

五、冰冷的数据:只有44%的AI代码被采纳

有一篇叫SWE-chat的论文,第一次大规模采集了真实的智能体编码会话:6000段、超过6.3万条用户prompt、35.5万次工具调用。

它得出一个扎心的数字:智能体产出的代码,只有44%最终进入了用户的提交里。有一半多的命运被人删了、改了、推翻了。

这说明,HumanEval那类老的基准测试已经刷到饱和,光看跑分意义不大了。真正的战场,是真实开发过程里那些反复、试错、推翻重来的数据。

模型越强,越要花钱去买人类还没被替代的那部分东西:工程直觉。

Anthropic花280美元一个任务,请来约1000名工程师做A/B投票:这套看上去笨重的活儿,买的正是这一点。

谁能把工程现场变成模型能消化的数据,谁就握住了进入AI编程下一程的入场券。

六、对中国产业的影响与启示

这场AI编程的"品味之战",对中国产业有三大启示:

第一,技术路线的选择至关重要。过去我们习惯了"数据标注+模型训练"的路径依赖,但现在AI竞争的焦点已经转向"过程数据+工程直觉"的更高维度。中国企业必须重新思考如何构建自己的数据优势。

第二,产学研合作模式需要创新。Snorkel从斯坦福AI Lab走出来,又在产业应用中成长。中国的科研院所与企业之间,也需要建立更紧密的、能够产生高质量过程数据的协作机制。

第三,人才价值被重新定义。过去我们看重的可能是算法工程师的数量,现在更重要的是资深工程师的"品味"如何被量化、被转化为训练数据。这意味着传统的人才培养和评价体系需要调整。

在具身智能产业链中,Anthropic的这次投入可能会沿着"成本↓ → 渗透↑ → 替代"的传导路径,从AI软件与控制系统开始,向上游影响算力芯片需求,向下游推动机器人整机和智能车载的智能化水平提升。

当其他公司还在用廉价标注数据训练AI时,顶级玩家已经在用280美元一小时的代价,购买人类工程师最宝贵的工程直觉。这不是技术的差距,而是认知的鸿沟。

未来五年,谁的AI拥有最好的"品味",谁就能在这场AI编程的终极对决中胜出。而品味,恰恰是最难被量化、最需要时间和经验积累的东西。

特别声明:产联社摘录或转载的属于第三方的信息,目的在于传递更多信息而非盈利,同时并不代表赞成其观点或证实其描述,内容仅供参考。转载信息版权归原媒体及作者所有,若有侵权,请联系我们删除。如其他媒体、网站或个人擅自转载使用,请自负版权等法律责任。

48
17
分享
上一篇 下一篇