CrazyJev Lab
Reaction 测试方法:每个毫秒数字到底测了什么
Reaction 对照页 从同一个应用信号启动玩家反应计时和 Jev 请求,同时展示一条可调的假设延迟。假设线没有调用聊天模型,也不是竞品实测。
三种不同的耗时
- 玩家:应用安排切换绿色到首次接受输入,包含显示调度、感知和输入事件延迟。
- Jev 请求:浏览器发起请求到收到并解析响应,包含网络、服务端、提供方调用与重试。
- 服务端模型调用:服务器调用提供方到拿到结果,包含网络与重试,不是纯推理时间。
应用在同一回调中安排变色和发请求,但没有屏幕真正发光的硬件时间戳。因此这是交互演示,不是人与机器的公平基准。
难度分数不等于推理速度
原版 Reaction 的 ÷2、÷4、÷8 是游戏难度规则。对照图使用未经除法处理的原始请求耗时。
复现步骤和样本口径
固定设备、浏览器和网络,保持页面在前台。开始后等变绿,只点击或按空格一次;提前输入算抢跑。等待 Jev 返回后重复,不删除慢请求和失败请求。
页面保留当前会话最近十个结束的回合。抢跑单独按整个页面会话计数;未点击与请求失败可见。中位数和 p95 使用成功请求耗时的最近秩算法;只有十个样本时,p95 就是最大值。失败局保留在回合分母内,但不虚构延迟。模型有效回应却选择不按下,不算成功反应。
真正的模型对照需要什么
需披露提供方与模型、等价输入输出、地区、超时、重试、并发、样本量及日期,交替运行并保存脱敏原始记录。在此之前,滑块只能表示“假如响应花了这么多毫秒”,不能推断某个聊天模型的实际表现。