跳到正文
原文
Hugging Face Blog·· 2026-09-02AI 评分38

Hugging Face 提出 BenchMIRT:在提示词粒度上审计大语言模型评测基准

BenchMIRT: What are LLM benchmarks actually measuring?

AI 导读

Hugging Face 发布 BenchMIRT 方法,基于多维 Item Response Theory 在单个提示词粒度上审计 LLM 评测基准实际测量的能力。

来源:Hugging Face Blog · huggingface.co