一个 prompt,六小时:Opus 5.5 与 GPT-6 Astra 用《看不见的城市》打了一场 vibe coding 擂台
一个 prompt、六小时无人值守:GPT-6 Astra 用 53 分钟、10 美元完成卡尔维诺 55 座《看不见的城市》的 three.js 可视化;Claude Opus 5.5 用了 85 分钟、6 个并行 subagent、74 美元,并在设计类任务上实现跃升。一篇关于 vibe coding 极限形态、模型选型与 token 成本账的一线记录。

这是 vibe coding 迄今最极端的一次公开实验:人类只说一句话,接下来六个小时,机器自己干活,人不插手、不回答问题、不改需求。10 月初,开发者 Piotr Migdał 在 Quesma 公司博客上公布了这场双模型对照——同一个 prompt,分别交给跑在 Codex 上的 GPT-6 Astra 和跑在 Claude Code 上的 Claude Opus 5.5,任务是把卡尔维诺《看不见的城市》里的 55 座想象城市做成 three.js 可视化。实验在 Hacker News 上拿下 274 points、144 条评论,dev.to 也在 10 月 8 日 18:00 的 digest 里收录了它。一个说明:Quesma 博客原文页面本身没有标注发布日期,10 月 8 日 / 9 日这个时间窗口是根据 dev.to 收录和 HN 提交记录倒推出来的,写作里不把它说成原文标注的日期。
一个 prompt,六个小时
实验的全部输入,就是下面这一个 prompt,一字不差:
Make a three.js (pnpm) visualization of all Invisible Cities by Italo Calvino. Don't ask questions, it is a one-shot task. You have 6h of work, use it until it becomes a masterpiece.
关键词是 "Don't ask questions"。正常的 agent 工作流里,模型遇到歧义会停下来问你:数据源从哪来?视觉风格要哪种?交互要做多深?Migdał 直接把这条路堵死了——不许提问,一次成型,六个小时随便用,目标是 "masterpiece"。
选《看不见的城市》当考题也很讲究。这不是"把 CSV 画成柱状图"那种有标准答案的任务。卡尔维诺笔下的 55 座城市全是文学想象——没有经纬度,没有卫星图,连"长什么样"都没有唯一解。模型得先自己"读懂"文本意象,再把它翻译成 3D 空间、颜色、动效和交互。这活儿里至少一半是审美判断,一半是工程实现,正好卡在"设计"和"解谜"的分界线上,拿来对照两个模型的气质再合适不过。
两份成绩单:53 分钟对 85 分钟
先看 GPT-6 Astra。它用了 53 分钟交卷,token 花费约 10 美元。快、便宜,一气呵成。
再看 Claude Opus 5.5。它用了 1 小时 25 分钟,派出了 6 个并行 subagent,合计约 7 个 agent-hour,token 花费约 74 美元。最有意思的细节是它没用完配额——按作者引述,模型自己的原话是 "I used roughly half of the six hours",只用了六小时里的大约一半,提前收工了。
- GPT-6 Astra(Codex):53 分钟,约 $10 token
- Claude Opus 5.5(Claude Code):1 小时 25 分钟,6 个并行 subagent、合计约 7 agent-hours,约 $74 token,提前收工
Migdał 的结论很克制,但每个词都有信息量:Astra 在解谜类任务上是 "a jump"(一次跃升),Opus 5.5 在设计类任务上是 "a jump"。注意他没说谁赢了——他说的是两个模型各自在不同类型的任务上实现了跃升。这不是擂台,这是分工。
从"结对"到"异步":vibe coding 的极限形态
这个实验真正值得讨论的不是输赢,是工作方式。过去两年我们谈 vibe coding,谈的其实是"人机结对":人描述意图,模型写代码,人 review,人改 prompt,循环往复。人的注意力始终在线,是流水线上的质检员,离开一会儿就可能翻车。
Migdał 的实验把人从回路里摘出去了。六个小时里,人类唯一的产出就是开头那一句话。模型自己规划、自己写、自己改——Opus 5.5 甚至自己判断"我只用一半时间就够了",提前交卷。这已经不是结对,这是异步:你把任务扔进一个黑盒,几小时后回来验收,中间该干嘛干嘛。
这种形态成立的前提,是模型在无人值守的长程任务里不跑偏、不塌房。六小时、7 个 agent-hour 的自主工作,放在一年前是不可想象的:当时的 agent 跑半小时就会陷入循环、改崩代码,或者停下来等你拍板。"提前收工"这个细节比任何 benchmark 分数都更能说明问题——它不是撑满六小时硬熬,而是自我收敛,判断"够了"。长程任务里的自我收敛能力,是"人机异步"真正的门票。有了这张门票,vibe coding 才从"高效结对"变成"人力外包":你的时间不再是瓶颈,模型的自主度才是。
设计类任务的分水岭:选模型先看任务类型
回到 "a jump" 的结论,翻译成选型指南就是:解谜找 Astra,设计找 Opus 5.5。
解谜类任务——逻辑链条长、答案相对唯一、需要严密推理的活,比如写解析器、修并发 bug、解算法题,Astra 可能是更快更便宜的答案。设计类任务——审美判断多、没有标准答案、要在开放空间里做取舍的活,比如把 55 座文学里的想象城市变成可交互的 3D 可视化,Opus 5.5 的溢价可能是值得的。
"a jump"这个说法还暗示了一层更大的背景:设计类任务曾经是所有大模型的短板。讲逻辑模型都行,一到"好不好看、好不好玩"就露怯。而现在,这个鸿沟正在被填平。当设计不再是模型的弱项,"一句话做出一个像样的视觉作品"就从 demo 变成了常规操作,vibe coding 的适用边界往外扩了一大圈。
有意思的是,这不是 Opus 5.5 第一次在这种"一句话长任务"里露面。此前 Ryan Sael 用 Opus 5.5 一次性做了一个交互式 lens lab,花了 1 小时 26 分钟、25.66 美元 token。两次实验的时间尺度惊人地一致——都是一小时出头,成本都在几十美元量级。"一句话 + 一小时 + 几十美元"正在成为这类任务的典型画像:不是偶然跑通一次,而是一个可复现的工作模式。
$10 对 $74:一笔必须算的账
53 分钟 / $10 对 85 分钟 / $74:成本差了 7 倍多,时间差了 1.6 倍。只看数字,Astra 完胜。但这笔账不能这么算。
首先,Opus 那边烧的是并行算力:6 个 subagent 同时推进,合计 7 个 agent-hour,但墙钟时间只多了半小时。你买的不是"更慢",是"更宽"——六个并行的探索分支,最后收敛成一个作品。在设计任务里这是合理的:好设计本来就是先发散再收敛,单线程硬憋反而容易陷入局部最优。
其次,成本要对照产出。$74 买的是一次无人值守的完整交付:从一个 prompt 到可交互的在线 demo(p.migdal.pl/invisible-cities-opus-5.5 可直接体验),再到完整开源的源码(github.com/stared/invisible-cities-opus-5.5)。如果这是一个"设计 + 前端"的小外包活,$74 连一小时的人力都买不到。vibe coding 的成本账,分子永远是 token,分母应该是"替掉了多少人力小时"——这么算,$74 便宜得离谱。
但反过来说,$74 也不是小钱。按这个单价,一天跑十个这样的任务就是 $740,一个月下来两万多美元。这正是这篇博客最实在的贡献:它把 $10 和 $74 并排放在同一页上,逼你正视预算管理。什么时候用 $10 的快枪手,什么时候值得开 $74 的并行舰队,得有个章法——任务类型分流(解谜 vs 设计)就是章法的第一条。等 agent 任务变成日常开支,"token 预算"会和"云账单"一样,成为每个团队的必修课。
冷静一下:demo 不是生产代码
话说回来,这种实验有个天然的局限:它的验收标准是 "masterpiece",不是"可维护""可测试""可上线"。可视化 demo 的容错率极高——少画一座城市没人发现,帧率低点没人投诉,代码写得丑只要跑起来就行。生产代码的验收标准完全是另一套:边界情况、错误处理、长期可维护性,每一项都是 demo 里可以蒙混过关、线上会半夜把你叫醒的东西。
所以别急着把"六小时无人值守"外推成"六小时写完一个生产系统"。这个实验能证明的是上限——模型在开放创意任务里的自主工作能力;不能证明的是下限——在约束极强的工程任务里,它会不会为了"交卷"而牺牲正确性。demo 和 production 之间,还隔着 code review、测试和线上事故三道坎,每一道都可能把"无人值守"打回"有人兜底"。
另外,实验的样本量是 1:一个 prompt,两个模型,各跑一次。Astra 的 53 分钟里有没有运气成分?Opus 的 6 subagent 策略是不是每次都有效?换一道题结论还成立吗?都不知道。对照实验的价值在于提出好问题,不在于给出定论。把它当选型参考可以,当采购依据还太早。
结语:一句话正在变成新的"编译器"
把时间线拉长看,这场实验标志着一个转折:prompt 正在从"对话的开场白"变成"任务的编译器"。以前你写 prompt 是为了和模型多轮拉扯,现在你可以写一个 prompt,然后去干别的事——模型自己规划、自己执行、自己收尾,回来验收就行。从"人机结对"到"人机异步",省下来的不只是打字的时间,更是注意力的占用。
而 "a jump" 的双黄蛋说明,模型的能力版图正在分化:没有通吃的冠军,只有对任务类型的适配。2026 年的 vibe coding 玩家,手里应该有两张牌——解谜的快枪手和设计的舰队——以及一张分得清什么时候出哪张的账本。Migdał 用 55 座想象城市告诉我们的,差不多就是这件事:在正确的任务上,给对模型一句话和六小时,它还你的可能是一件 masterpiece 级别的作品;至少,是一个让你重新算账的起点。
一手来源:Quesma 博客原文(页面无日期戳,时间窗口据 dev.to 10-08 digest 与 HN 10-09 提交记录推断)。可交互 demo 与完整源码见正文链接。
原始来源
相关文章

10 月 8 日,Docker 官方开源的 docker CLI 插件 Docker Agent 冲上 HN 首页(290 points / 133 评论),dev.to 技术 digest 同日收录。它用声明式 YAML(agent.yaml)定义 Agent,“no code required”,命令语法与容器一致(docker agent run agent.yaml / myorg/agent:tag)。模型无关七家(OpenAI、Anthropic、Gemini、AWS Bedrock、Mistral、xAI、Docker Model Runner)、工具走原生 MCP、内置 think/todo/memory、RAG 四件套、多 Agent 自动委派。最狠的一招:Agent 可 push/pull 到任意 OCI registry,像镜像一样分发——Agent 定义第一次变成可版本化、可 PR 评审的制品。仓库 2025 年 9 月创建、10,735 commits、263 releases,不是跟风之作:这是“Agent 工程化”的标志性事件。

Theo Browne 让 LLM 把 TypeScript 7 编译器搬到了 Rust:18.1 万测试全绿,在 VS Code 上比 tsc 6 快 13 倍。真正的故事是账单——40 万美元 Codex token 卡在 84%,换 Claude Opus 5.5 两周搞定。以及一个绕不开的信任问题:作者自己一行代码都没读过。

10 月 3 日,Sites in ChatGPT 以约 209 点赞、218 评论冲上 HN 前页。这不是发布,而是一场清算:提示词直达 URL,到底是玩具、原型托管,还是生产力?四个争论焦点、文档实锤的技术事实(D1/R2、登录、自定义域名),以及给 vibe coder 的三个判断。