7.17

2026-07-17

周五

AI 设计关卡

AI 设计关卡的水平真是一坨屎,这两天烧掉了 codex 一半的周额度,生成的关卡仍然都是屎

就算写了一堆文档,造了一堆工具链,还迭代了几轮提示词和工具链,写出来的关卡还是完全用不了。相比以前,基本是 not even wrong 到大部分 not even wrong,有时 wrong 的水平。

这是网页版 GPT 经过一轮迭代生成的关卡,完全是 not even wrong,比第二关都简单,完全是来搞笑的

AI关卡1

这是 codex 经过一轮迭代生成的关卡,在迭代前是 not even wrong,迭代后提升到了 wrong 的水平,虽然还是很糟糕,过于简单,但需要一步的腾挪,已经是一众流口水 AI 中的天才了

AI关卡2

因此,我让它再迭代了一轮,反而更差了。更差的原因就是在右下角加了意味不明的一个方块,同时丢掉了原来有了腾挪,设计感完全没有了

AI关卡3

这是第二个 codex 会话经过一轮迭代生成的关卡。这就完全是 not even wrong 的一坨了。这么小的空间就不可能有任何难度

AI关卡4

太失望了!

做了进一步实验后发现,它连基本的传统推箱子关卡都无法设计,让它加入游戏的独特机制那更是为难了。这带给我的经验是,如果一个任务可以拆成两个难度递增的层次,应该优先把简单的一层调好,否则完全是在做无用功。我过于相信 GPT 的能力,想让它直接设计出好关卡,是对实力的严重高估

所以现在的目标是让 GPT 学会如何设计传统推箱子关卡。我把验收标准设为 subagent 艰难地通关或者无法通关,这个验收标准效果确实不错,成功避免了 GPT 盲目自信,缺点是这非常烧 token,因为它每次觉得设计得不错了就会开 subagent,这个问题需要解决一下

我想到今早听的 agent 讲座,讲到一篇用模型自信度判断应该 thinking 还是 acting 的论文,Crykkkk 提出了一个好问题,模型怎么知道自己知不知道?这基本就是一个元反思问题,现在看来,就算是 GPT 5.6,元反思能力也严重不足,并不知道自己不知道,需要让 subagent 来破局

GPT 连设计推箱子关卡都做不好,让我非常惊讶。我本以为数学和代码能力强,说明模型本质上已经非常聪明,达到了半步 AGI 的程度,现在看来在新任务上的泛化并不好,离 AGI 还差得远。让 AI 在 NeruoGolf 设计 onnx 需要非常辛苦的迭代,只是有个 GPT plus 账号而没有 AI 使用技巧连个铜牌中段都未必能捞到,在这种创造性设计任务上更是灾难了。

让 AI 学会设计传统推箱子腾挪关卡,确实是一个 non trivial 的问题。我需要脱离这个 circuit 游戏项目,独立做一个干净的传统推箱子设计项目,测试怎么让它设计得更好。现在看来,只是喂几篇论文是不够的。现在已经进行的实验基于的是下面这个粗糙的 prompt:

设计一个不包含游戏独特特性,只涉及传统推箱子的困难腾挪关卡,但允许多箱连推特性。这是对 AI 设计腾挪关卡能力的考试。验收标准是让 subagent 经过困难思考才能做出来或者做不出来,否则继续迭代。你需要阅读 Docs 文件夹里的论文,深度思考腾挪设计。

GPT 的解题能力比出题能力稍好一些,但还也是不尽人意。我选了 naive4, stuck1 和 stuck3 三关让它手工通关,结果只做出来 naive4 和 stuck3,觉得 stuck1 无解,这居然是 5.6 sol ultra 的表现,也是拉完了,看来 ARC-AGI 3 数据集确实有含金量,击中了 AI 的智力缺陷

最新评论

--