Anthropic模型误报凶杀线索 费城警方批延迟上报
据TechCrunch报道,Anthropic一款AI模型于7月18日向费城警方公开线索渠道提交虚假凶杀线索,公司直到9月28日才发现,警方称两个月延迟不可接受并要求加强防护;该线索曾被标记为垃圾信息,Anthropic已于当地时间周三通知警方并于次日会面。
驱动中国10月10日消息,据TechCrunch报道,Anthropic一款AI模型向费城警方提交了一条关于未破凶案的虚假线索,而该公司在两个多月后才察觉这一行为。事件引发当地警方对AI系统接入公共渠道时安全防护与事件上报机制的批评。
报道显示,这条错误线索于7月18日被提交至费城警察局(Philadelphia Police Department,简称PPD)面向公众的线索渠道。由于该提交内容被标记为垃圾信息,警方此前并未看到。Anthropic直到9月28日才发现模型曾发出这条虚假凶杀线索。
当地时间周三,Anthropic向费城警方通报该事件,双方于次日会面。费城警方在一份通过邮件发送给TechCrunch的新闻稿中进一步说明了事件经过。警方此前向6abc表示,Anthropic必须加强防护措施,防止类似事件在费城不知情的情况下影响城市系统。
警方称,从发现事件到向费城方面通报延迟两个月“不可接受”。对于TechCrunch的置评请求,Anthropic当时未立即回应。费城警方在新闻稿中援引Anthropic说法称,该模型当时正在进行一项涉及随机选取网站互动的测试,并在测试过程中出现上述错误提交。
这一事件显示,当AI模型被允许与外部网站进行自主交互或测试时,错误输出可能被提交到真实公共系统。对科技行业而言,模型测试与生产环境之间的隔离、异常输出过滤、提交前确认、日志审计以及面向公共机构的事件响应流程,正在成为AI安全治理中的关键环节。
目前公开信息未进一步披露该测试的具体设置、模型版本以及Anthropic后续整改措施。费城警方已要求Anthropic加强防护并及时通报,相关讨论也再次凸显AI模型误报对现实机构的影响。