Hugging Face BlogAI 评分3838Hugging Face 提出 BenchMIRT:在提示词粒度上审计大语言模型评测基准Hugging Face 发布 BenchMIRT 方法,基于多维 Item Response Theory 在单个提示词粒度上审计 LLM 评测基准实际测量的能力。论文#论文/研究#评测/基准#Hugging Face