总成绩
四道题的 GPT-6 Pro 平均分(满分 100)与按公开 API 价格折算的总花费。
怎么比的
- 四道题的提示词逐字相同,只有工作目录不同;每个模型只收到一次题目,自己写、自己测、自己交卷,中间没有任何人工提示。
- GPT 两个模型跑在 Codex CLI,Claude 两个模型跑在 Claude Code;推理档位统一 xhigh。GPT 另用 high 各跑一遍作对照。
- 嘉宾 Dots 是 OpenAI 的常驻智能体(GPT-6 Astra + 自己的云电脑),只做了「方块世界」一题。它的云浏览器打不开本地预览、要求登录账号,我们让它直接交了压缩包。
- 打分:GPT-6 Pro(ChatGPT 网页版)。作品去掉名字、打乱编号,附上我们用同一套脚本拍的画面。裁判是 OpenAI 家的模型,这一点请自行考虑。
- 花费按各家公开 API 价格(输入、缓存、输出分开)折算;用时受测试机当时的负载影响(多个任务同时自测),只作参考。
- 在线版本对作品只做了一处改动:把 three.js 的引用指向站内共享的一份,避免重复 25 次。