Hugging Face Blog·· 2026-09-02AI 评分38
Hugging Face 提出 BenchMIRT:在提示词粒度上审计大语言模型评测基准
BenchMIRT: What are LLM benchmarks actually measuring?
AI 导读
Hugging Face 发布 BenchMIRT 方法,基于多维 Item Response Theory 在单个提示词粒度上审计 LLM 评测基准实际测量的能力。
来源:Hugging Face Blog · huggingface.co