跳到正文Cool CodeCool Code
登录控制台

效率雷达

同一份口径下比较本网关在售的各模型:私有题集在新模型或新题集接入时(按需,非定期)经本网关按「模型 × 档位」实跑的表现分,加上真实流量的时延与单请求费用。指标怎么算,全部写在页面底部。

时延单位:秒(单请求口径) · 费用单位:USD / 请求

正在加载最新数据…

口径与方法

表现分从哪来

一套不公开的精确答案题集,在新模型或新题集接入时(按需,非定期)经我们网关按「模型 × 档位」逐格实跑打分(0-100)。题集分批轮换,防止针对性过拟合;每格每轮 30 题,单轮分数有约 ±8 分的正常波动。矩阵分数合并最近至多 3 轮同一题集批次的采样——样本更大、区间更窄;题集换批后从新批次重新累计。历史曲线仍按单轮原始分绘制,看趋势请以其滑动均值为准。

时延与费用怎么算

优先取我们网关近 24 小时真实成功请求,按「模型 × 档位」聚合单请求平均耗时与单请求均价;某格暂无真实流量时,耗时退回跑分实测值并加 † 标注。这是单请求口径,不是 Agent 整任务耗时。

数据来源与脱敏

成本与时延来自全量真实网关流量,不是抽样众测。调用量只公布相对趋势(各自 7 天日峰值的百分比),不公布绝对量。

更新频率

跑分按需进行——新模型或新题集接入时测评一轮,非定期;每轮完成后矩阵与历史曲线随之更新;时延与调用量每 10 分钟聚合一次。失败请求不计入统计,也不计费。

第三方参考

自建跑分只保证站内可比,不等价于公开基准。作为外部锚点:Vals AI 独立评测的 Vals Index 准确率为 Grok-4.6 71.82% ± 0.75(47 个模型中第 6),取数于 2026-08-13。