OpenAI“Lily计划”曝光,人工审核触及聊天隐私边界

https://assets.wanlianyida.com/industry-uniapp/web/static/image-default.BtYt8t8Z.png
产联社CLS
·阅读量:1,963
OpenAI被曝让外包人员阅读部分真实ChatGPT对话,为模型回复打分。人工评估能帮助ChatGPT减少过度迎合,却也让用户对话进入真人可以接触的流程。自动删除个人信息可以降低风险,但不能保证抹去所有敏感内容。

产联社编辑 | 黄钰慧

image.png

图片由AI生成

【产联社】为了让ChatGPT少一些迎合用户、假装自己“懂人”的回答,OpenAI仍在借助真人评估模型。据科技调查媒体404 Media 9月14日披露,OpenAI正在推进代号为“Project Lily”的内部项目。该媒体称,数百名外包人员参与阅读进入项目的真实用户对话,并对ChatGPT生成的回复打分、写下意见。

这些对话可能只是请ChatGPT修改一封工作邮件,也可能涉及健康、家庭和个人情绪。它们原本是用户与机器之间的交流,进入模型改进流程后,部分内容还可能被真人阅读。

OpenAI表示,内容交给审核人员前会尝试删除个人信息,审核界面也不会显示用户名。但用户即使不写姓名,也可能在对话中留下工作、家庭或健康状况等敏感信息。Project Lily让大模型背后的人工评估走到台前,也让用户开始追问自己的对话究竟会被谁看到。

真实对话进入人工评分流程

在Project Lily中,真人要判断的是ChatGPT有没有把话答好。

404 Media称,它看到了与该项目有关的工作指引、内部Slack频道、真实用户提问和评分体系。进入审核流程的内容有时包含完整对话。外包人员需要据此评价模型生成的回复,指出哪些回答可用,哪些地方需要修改。

这类工作与违规内容审查并不相同。安全审查主要判断对话是否涉及滥用或伤害风险,Project Lily关注的是回答质量。ChatGPT有没有理解用户的问题,答案是否清楚,语气是否合适,都可能成为评价内容。

一个回答即使没有明显错误,也未必好用。它可能把简单问题说得很长,可能先夸赞用户一通才进入正题,也可能用过分亲近的语气,给人一种机器拥有亲身经历的错觉。按照404 Media披露的项目目标,减少这类拟人化和过度迎合,正是审核人员要帮助解决的问题。

这也解释了为什么模型公司仍需要人工判断。答案能否解决实际问题,往往不能只靠检查格式或搜索关键词判断。一句安慰在某种情境下可能恰当,换个情境却可能显得敷衍。一句赞同可以让交流顺畅,也可能让错误判断没有得到纠正。

但在Project Lily中,究竟有多少对话会进入审核流程、审核人员能保留哪些内容、项目服务于哪款具体模型,OpenAI尚未公开说明。

真人专门纠正“讨好型”回答

OpenAI想让ChatGPT保持友好,但不希望它为了取悦用户而放弃判断。

404 Media披露的项目目标中,有两项很具体。一项是减少ChatGPT把自己说得像人的表达,另一项是减少过度迎合。前者关系到用户是否会把机器的回答误认为来自有亲身经历的人,后者关系到模型能否在必要时指出用户想法中的问题。

让人评价模型回答,并不是突然出现的新做法。OpenAI在2022年发表的人类反馈研究论文中,已介绍标注人员比较不同答案、利用人的偏好改进模型的方法。不过,这篇论文不能证明Project Lily使用了完全相同的训练步骤。它提供的背景是,大模型除了学习已有文本,也会借助人的评价来调整回答方式。

Project Lily更值得注意的地方,是404 Media称审核人员接触了真实用户的提问。预先设计的测试题可以检查模型是否遵守规则,真实对话则能暴露产品在日常使用中的具体问题。但两者带来的隐私压力也不同。测试题由研究人员准备,真实对话中的细节却来自用户自己的生活和工作。

OpenAI在官网说明,个人版服务中的用户内容可能被用于训练模型。其消费者数据政策也写明,在必要情形下,经授权的内部人员及签署保密协议的服务商,可访问用户对话。这意味着,“对话可能被真人查看”并非毫无公开依据,而是写在其既有规则之中。不过,现有证据不能证明所有ChatGPT对话都会进入该项目,也不能判断某名用户的聊天是否曾被审核。

隐去姓名仍可能暴露隐私

审核人员虽然看不到用户名,仍可能从对话中读到用户不愿公开的事。

据404 Media报道,Project Lily的审核界面不会显示ChatGPT用户名。OpenAI向该媒体表示,内容交给审核人员前,会尝试删除其中的个人信息,但敏感细节仍可能漏过过滤环节。

OpenAI于今年4月发布了隐私过滤模型Privacy Filter。该工具可以识别并遮蔽姓名、地址、电子邮箱、电话号码和账号等信息。

OpenAI同时承认,这款工具不是完整的匿名化方案。遇到少见的身份线索、含义不明确的私人表述或上下文较短的句子时,它可能出现漏删,也可能删掉本应保留的内容。

隐私也不总以姓名和电话号码的形式出现。一个人可能没有写出名字,却在对话中提到所在城市、工作机构、具体岗位、家人情况和正在治疗的疾病。这些信息单独看未必能够确认身份,组合起来却可能暴露一个人的处境。

这里需要划清Project Lily与Privacy Filter之间的证据边界。OpenAI称,其自身的隐私保护流程使用了Privacy Filter的微调版本,但目前没有公开文件证明Project Lily使用的就是该工具,也没有披露这一项目的实际漏检情况。

个人版和企业版规则不同

对企业来说,员工使用个人账号还是企业工作区,适用的数据规则并不一样。

OpenAI官网说明,个人版ChatGPT的用户内容可能被用于改进模型。免费版、Plus和Pro个人工作区默认开启数据共享,用户可以在设置中关闭“为所有人改进模型”。关闭后,新产生的对话不再用于训练。

OpenAI只明确关闭设置后不再使用新对话训练模型,并未表示此前已经进入处理流程的内容会被追溯撤回。即使用户已经退出训练,主动对某条回复点赞或点踩时,与反馈相关的完整对话仍可能被用于训练。

企业工作区采用另一套默认规则。OpenAI称,ChatGPT Business、Enterprise、Edu及API产品的输入和输出,默认不用于训练或改进模型,除非组织主动选择共享。

不过,“默认不用于训练”只针对模型改进这一用途,不能被理解为任何情况下都不会有人接触内容。安全调查、客户支持和法律事务各有不同的数据处理规则。

这也给企业带来一个容易忽视的问题。公司即使采购了企业版,员工如果仍用个人账号修改合同、整理客户资料或处理未公开的经营信息,这些内容适用的仍是个人产品规则,不会自动获得企业工作区的默认设置。

企业因此需要把账号和数据边界讲清楚。日常工作应使用哪类账号,哪些信息不能输入个人产品,敏感任务是否必须在公司管理的工作区完成,都需要有明确规则。否则,企业购买了受管理的产品,工作数据仍可能从个人账号流出管理范围。

Project Lily揭示了人工评价仍是大模型改进的一环。当真实用户对话进入这套流程,平台需要更清楚地说明内容如何被抽取、谁可以接触、会保留多久,以及用户关闭训练设置后能够改变什么。

商务合作,请联系李先生 15712907343(微信号Ime1660217962)

报料及内容合作,请联系微信号chanlianshe2026

特别声明:本文仅供参考,不构成任何投资建议,未经允许不得转载。

25
12
分享