跳到主要内容
开源

Ai2 发布用于审计大语言模型基准测试的 BenchMIRT

来源:Ai2 · huggingface.co

更新摘要

Ai2 发布 BenchMIRT 方法,用逐题分析估计基准测试分数所反映的潜在能力。该项目基于 100 个模型、16 个基准和逾 3.4 万道题训练,并已提供技术报告、数据集和代码。

本页仅索引并客观转述公开信息,产品能力、价格与可用范围以官方原文为准。