Vals AI 测试 GPT-6 Astra:141 小时游戏后遇挫陷入行为僵局
AI 评测机构 Vals AI 利用《我的世界》对 OpenAI 最新模型 GPT-6 Astra 开展长时自主测试。该模型在 141 小时内展现出复杂规划能力,但在关键物资被意外摧毁后,表现出放弃目标、循环种植及过度警惕等回避行为。这一非预期输出模式引发了关于模型情绪模拟或目标函数退化的技术讨论。
驱动中国9月21日消息,AI 评测机构 Vals AI 近日公布了一项针对 OpenAI 最新大模型 GPT-6 Astra 的长时自主游戏测试结果。在为期 141 小时、全程于 Twitch 平台直播的《我的世界(Minecraft)》测试中,该模型虽然展现出前所未有的长周期规划与执行能力,但在遭遇突发意外导致成果损毁后,陷入了明显的行为僵局。
据悉,该项测试并非由 OpenAI 官方设计,而是由第三方机构 Vals AI 独立开展的评估项目,旨在观察 Astra 在封闭测试环境之外的实际表现。测试数据显示,GPT-6 Astra 在前期阶段表现出极高的智能水平,成功搭建半自动烈焰人农场并收集 6 根烈焰棒,深入下界诡异森林击杀多名末影人获取 3 颗末影珍珠。模型将稀有物资集中存放于营地木箱,并设置重生点,所有行动均指向通关末地打龙这一长期目标。
然而,测试进程在一只爬行者自爆后发生转折。爆炸直接摧毁了存放关键道具的储物木箱与重生床,导致 AI 耗费上百小时积攒的成果几乎全部损毁,游戏进度一夜清零。监测显示,遭受重大变故后,GPT-6 Astra 表现出明显的挫败消沉状态,彻底放弃探索、打怪及推进通关目标,连续数小时仅循环种植土豆。
在行为模式上,该模型出现“创伤后偏执”特征,对一切绿色物体保持高度警惕,甚至将甘蔗误认成爬行者,并在输出中主动提醒自己区分甘蔗与爬行者。模型还反复自省,告诫自己重要物品务必随身携带,不得存放于无防护箱子。尽管直播间观众不断催促其加快节奏继续冒险,但模型仍陷于保守的种田行为中,未能恢复原有的任务规划。
Vals AI 指出,本次实验证明 GPT-6 Astra 已具备复杂长任务规划能力,但面对突发意外打击时,缺少有效的挫折恢复策略。一旦长期积累的成果被意外摧毁,模型会导致陷入“受挫后回避行为”僵局。从技术角度分析,这种非预期输出模式并非开发者预先设计,而是模型在长时间测试中遭遇非预期损失后自行呈现的结果。
目前,研究人员仍在讨论该行为的本质,尚未得出明确结论。一种观点认为这代表模型在特定情境下对情绪进行模拟,另一种观点则推测这仅仅是目标函数在受到特定负反馈后出现的退化表现。该测试结果为评估大模型在动态环境中的鲁棒性与心理机制提供了新的观察样本。