OpenAI Lily项目曝光:人工审核ChatGPT聊天记录

AI 驱动中国 时雨 982次阅读
分享 Q
AI摘要
由 AI 生成 · 仅供参考

驱动中国9月15日消息,OpenAI被曝正推进内部代号为Lily的项目,通过人工审核ChatGPT用户聊天记录来优化大模型,该做法在提升模型表现的同时,也引发用户隐私与数据安全担忧,并揭示AI训练背后高昂的人力成本。

驱动中国9月15日消息,OpenAI一项内部代号为Lily的项目近日曝光,该项目由专门的人工审核员查看ChatGPT用户与AI的聊天记录,通过人工标注和反馈来优化大模型的表现。消息传出后,外界对聊天隐私与数据使用边界的讨论迅速升温。

从已有的曝光信息来看,Lily项目并不面向外部用户,而是OpenAI内部模型训练体系中的一个数据工程环节。审核人员需要接触真实对话样本,判断模型输出是否合理、是否带有偏见或不当内容,并将整理后的标注结果用于模型迭代。相比依赖测试人员自行编写对话,这种方式能直接覆盖真实使用场景中的长尾问题。

人工参与对话模型训练并非首次进入公众视野。主流大模型普遍引入基于人类反馈的强化学习机制,让模型理解用户的偏好与安全边界。Lily项目的特殊之处在于,它把训练数据的来源延伸到了普通用户与ChatGPT的日常交互中,这使得数据规模更大、样本更真实,但隐私风险也随之上升。

对于用户而言,最令人不安的是对话内容被人工逐条查看的可能性。虽然OpenAI在使用条款中列明了数据用途,但许多用户在选择是否允许时并不清楚具体环节。聊天记录往往包含个人信息、职业状况、生活习惯等敏感内容,一旦进入审核流程,用户实际上很难控制这些信息如何被使用。

事实上,大模型训练中的人工审核环节早已成为行业惯例,部分流程由第三方数据服务商承接,标注人员需要签署保密协议。此次Lily项目曝光后,外界关注的焦点之一是哪类人员可以访问原始聊天记录,以及审核过程中是否执行了脱敏处理。这些细节直接决定项目的合规程度。

从商业角度看,Lily项目也折射出AI企业对高质量数据的需求。随着模型能力提升,低质量、重复性的合成数据难以支撑进一步优化,真实对话的稀缺价值凸显。但真实数据的使用受到法律和伦理双重约束,一旦处理不当,企业将面临信任危机与监管处罚。

有观点认为,透明化是化解争议的关键。AI公司应当向用户提供更直观的设置选项,让用户明确知晓自己的对话是否会被用于训练,并允许用户随时退出。与此同时,内部审核项目需要建立严格的访问控制、数据脱敏和审计机制,确保人工介入的环节不会变成隐私泄露的漏洞。

目前,Lily项目的具体规模、运作方式与数据范围仍有待进一步披露。可以确定的是,在生成式AI加速迭代的当下,企业围绕数据获取与使用的每一次尝试,都会面临更多的审视。AI行业如何在模型能力与用户权益之间取得平衡,已不再只是一个技术问题,而是一个需要持续回答的公共命题。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com
本文价值 4.5 2 人已评
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录
我要投稿有独家观点或行业线索?向驱动中国投稿,审核采用后署名发布并获积分奖励。 去投稿 ›

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友