可信中心 / 模型证据

模型证据,而非万能排名。

使用信誉良好的评估来回答明确的工作流问题。本登记表链接至来源的方法说明与榜单;它不复制当前排名数值、不合并不可比的指标,也不把质量分数带入经济计算公式。

返回工作台

准入约定

01先问问题,再看顺序

每个来源都必须说明它能够和不能回答的决策问题。

02先看方法,再看指标

提示词、评审者、类别、刷新方式和不确定性都应随链接一并说明。

03先确认权利,再展示数据

在明确获得数据复用权之前,产品只链接至来源运营方,不复刻榜单。

全球证据登记表

可信来源,按各自维度使用。

当前状态经过有意的保守处理。“仅链接”表示该来源可帮助用户发现证据,但工作台不会声称拥有或再分发其结果。

问题
人们在盲测成对偏好评估中如何比较回复?
方法
众包成对人类偏好评估,类别持续演进,并开展考虑置信度的排名研究。
版本
实时榜单 / 特定类别
局限
偏好、风格、抽样和用户自选择效应不能证明工作流经济性或事实可靠性。
维护状态
每月复核方法与运营方
权利
仅链接
问题
透明、可复现的场景评估说明了什么?
方法
学术评估;按榜单发布提示词、场景、指标和结果语境。
版本
特定榜单与发布版本
局限
不同榜单的覆盖范围和新鲜度各异;较旧且范围狭窄的榜单不能代表当前通用能力。
维护状态
按发布版本与榜单复核
权利
仅链接
问题
系统在定期更新且有标准答案的客观题上表现如何?
方法
带日期的多类别发布,通过定期刷新降低数据污染。
版本
特定发布版本
局限
不同发布版本的难度和覆盖范围会变化,因此跨版本次序不能直接互换。
维护状态
按发布版本与代码仓库复核
权利
仅链接

Artificial Analysis

打开官方来源 ↗
问题
独立测量的能力、速度、延迟和价格有何差异?
方法
发布方法说明和定义明确的 API 指标,并明确要求注明来源。
版本
持续更新的运营方数据集
局限
综合指数和提供商映射需要解释;对外再分发还需单独获得许可。
维护状态
每月复核方法与条款
权利
仅链接
问题
编程系统在新发布的竞赛题上表现如何?
方法
持续更新的编程评估,使用较新的竞赛题并涵盖多种代码能力。
版本
特定数据集发布版本
局限
竞赛编程不能代表代码仓库维护、产品架构或长期运行的智能体工作。
维护状态
候选来源 / 代码仓库复核
权利
候选

产品边界

证据用于判断用户自定的门槛,绝不会成为经济计算中的隐形乘数。

日后报告引用来源时,应将有日期的发布版本、方法、映射置信度和已知局限与成本决策一并保留。