开源
Ai2 发布用于审计大语言模型基准测试的 BenchMIRT
来源:Ai2 · huggingface.co
更新摘要
Ai2 发布 BenchMIRT 方法,用逐题分析估计基准测试分数所反映的潜在能力。该项目基于 100 个模型、16 个基准和逾 3.4 万道题训练,并已提供技术报告、数据集和代码。
本页仅索引并客观转述公开信息,产品能力、价格与可用范围以官方原文为准。
来源:Ai2 · huggingface.co
Ai2 发布 BenchMIRT 方法,用逐题分析估计基准测试分数所反映的潜在能力。该项目基于 100 个模型、16 个基准和逾 3.4 万道题训练,并已提供技术报告、数据集和代码。
本页仅索引并客观转述公开信息,产品能力、价格与可用范围以官方原文为准。