TRTOKEN RESEARCHPUBLIC OBSERVATORY 进入中转站

KEEP THE REASONING. SEE THE RESULTS.

ChatGPT 不降质分组
实时智力测试。

这里是 Token Research 为「ChatGPT 不降质分组」设立的公开观测台。以每 10 分钟一轮的节奏,通过糖果推理题与鹈鹕动画题两项测试,观察回答与生成质量。结果公开,直接查看,无需填写 API Key。

数据来源正在读取已导入的测试档案。未接入监测服务前,不显示虚构的实时状态。

REASONING / 逻辑推理

一袋糖果,最少取几颗?

三种口味、两种可凭手感辨别的形状。寻找保证拿到“异形、异味苹果与桃子糖”的最小数量。

最终答案 21 才算通过

CREATION / 图形与动画

让一只鹈鹕,骑起自行车。

创建一个 HTML,用 SVG 绘制鹈鹕骑自行车的 2D 动画。不得使用任何技能,直接呈现生成结果。

查看原始 HTML

01 / CANDY ASSAY

糖果题光谱

样本回答通过率
通过 / 有效回答
未通过
请求失败
通过未通过请求失败无数据检测中
等待数据
糖果响应耗时 按实际请求顺序 / 秒

同一格内的多条记录合并展示,点击可查看每条回答。没有记录的时间保留为空,不补造测试结果。

02 / PELICAN RIDE

鹈鹕骑行

同一道题,不同次生成。把原始 HTML 缩小放在这里,点击即可放大观看动画。

READING THE SIGNAL

如何读懂这些结果?

01 — 判分

只看最终答案

糖果题最终答案为 21 才通过。最终答案不是 21,或没有明确答案,均记为未通过。推导中提到 21 不算通过。

02 — 统计

请求失败,单独记录

通过率 = 通过次数 ÷ 有效回答次数。请求失败不进入回答通过率分母。同格多条记录按“未通过 → 请求失败 → 检测中 → 通过”的优先级显示。

03 — 探测

两道题,独立请求

监测方案为每 10 分钟发起两项独立测试,不沿用上一轮对话。糖果题禁用外部工具,鹈鹕题禁用技能;历史档案与在线数据分开标记。

TOKEN RESEARCH

从观察,到研究。

观测台看结果,中转站开始使用。

进入 Token Research 中转站

TEST PROMPT

测试题目

CANDY / ORIGINAL RESPONSE

糖果原始回答

PELICAN / ORIGINAL HTML

鹈鹕骑行

隔离预览 · 保留原始生成内容