CrazyJev Lab
Room Rush 如何使用 Jev:从页面状态到确认收集
Room Rush 给 Jev 75 秒购物时间。它在真实浏览器里查看 IKEA 页面,从当前可用动作中选择下一步,并确认商品是否收集成功。没有结账和付款;CrazyJev 与 IKEA、TypeSafe AI 均无隶属关系。
状态 → 决策 → 动作 → 确认
浏览器读取页面、候选商品、房间主题、已收集清单和剩余时间。Jev 从允许的动作中作选择;程序验证后执行搜索、打开商品、滚动或添加商品。房间内电脑展示浏览过程。
点击添加不等于收集成功。程序检查购物状态后才把商品计入清单,再把新状态交给下一次决策。浏览器启动发生在 75 秒计时之前;网页加载耗时也不等于模型决策耗时。
结果中的数字
商品数指服务端最终记录的不同商品。决策次数指有效且通过验证的动作选择,不把一次重试自动算成新决策。旧记录缺少数字时显示“未记录”,不是零。
计时结束可能一个商品都没找到。增长统计中的有效完成,要求至少一个确认商品且结果确实展示给玩家;取消、失败和空结果分别记录。
如何复现
打开 Room Rush,选房间和主题,同时观察电脑、倒计时和清单。结束后检查商品,再生成分享链接。公开结果保留 90 天,不公开私人备注或生成图片的凭证。
同主题挑战沿用房间和种子,不保证相同商品:库存、网页响应、模型选择及近期收获都会影响结果。自定义备注不公开,因此新玩家需要填写自己的需求。
成本与证据边界
本文尚无经账单核实的单局美元成本。成本必须包含全部调用尝试、浏览器运行、存储以及可选图片生成。不能用决策次数乘一个假定单价代替账单。
实测应记录代码版本、提供方和模型、地区、日期、请求成功与失败、浏览器时长及计费单位。报告必须保留失败局和空结果的分母。房间生成图只是构想,不是测量方案或购买凭证。
本文说明实现和统计口径,尚不证明总体成功率、平均成本或对其他模型的速度优势。一条公开结果只能证明这一局记录的结果。
开发实测:2026 年 9 月 20 日
共保留 11 次真实尝试:4 次完成且有确认商品、2 次完成但为空、3 次失败、2 次因开发重载中断。4 份非空收据各有 1–2 件商品、6–10 次有效决策,购物窗口均为 75 秒,并成功生成本地公开分享记录。
环境为本地 Next.js、Wrangler 存储、真实 Cloudflare 远程浏览器及经 Vercel AI Gateway 调用的 Jev。调试中修改过代码,未逐局记录补丁哈希,因此这不是固定版本基准测试,也不能推算生产成功率。分母保留全部尝试;账单成本仍未知。
最后连续出现两次空结果和一次浏览器超时,因此未凑足计划中的 20–30 局。确认失败时的截图显示购物袋仍在加载;没有把点击算成成功。应先排查页面就绪问题,再恢复较大样本采集。下载脱敏记录。
后续记录:全部 21 次开发实测
各批次合计保留 21 次尝试:10 次完成且有商品、2 次空结果、7 次失败、2 次中断。完成的非空收据各有 1–3 件商品、6–11 次有效决策,10 次均生成了本地公开分享记录。后续批次带有源码指纹;最后一局期间恢复了首页定位文案,已明确标注源码变化。这些记录跨多个开发版本,不能作为固定版本基准测试。前述 11 次的初始快照仍单独保留。