GPT-6 Astra 通关《传送门》的实验,这两天受到关注。作者 CozyBlaze 已公开控制器、工具修改和脱敏会话记录。比起只看“自主通关”四个字,仓库里的运行条件更值得读。
模型思考时,游戏会暂停
按作者说明,模型读取截图、角色位置和视角,决定下一组操作,再让游戏运行一段时间,随后停下来检查结果。这套装置给了模型观察和思考的时间;不能把它理解成人类玩家连续盯着屏幕、实时移动鼠标的同一种玩法。
作者称,实验在旧金山时间 9 月 5 日到达片尾,整个过程约 23 小时 43 分钟,包含额度中断和等待。他在额度报错后恢复了运行,并切换过 Fast 模式。游戏操作由智能体处理,但运行过程仍有人维护。这些条件都写在原始仓库里,不该在转述时省掉。
看长任务,要把中途怎么接回来算进去
我的关注点是:一个任务停下来以后,还能不能接着做。工作里的 Agent 同样会遇到额度用完、工具断开、页面变化。只看最后的成功画面,很难知道恢复工作究竟由模型、程序还是人完成。
这次公开材料给了一个具体检查入口:控制器如何执行动作,会话怎样记录过程,异常以后怎样继续。它展示了一次任务的完成路径,尚不足以推出“换个游戏也能过关”或“所有长任务都能无人值守”。
如果你正准备把一项耗时工作交给 Agent,先挑一个可恢复的任务试跑,并记下中断次数和每次人工介入的原因。这比只记录最终有没有交付,更容易看出下一步该补哪一段程序。