Hugging Face 提出 BenchMIRT:在提示词粒度上审计大语言模型评测基准
Hugging Face 发布 BenchMIRT 方法,基于多维 Item Response Theory 在单个提示词粒度上审计 LLM 评测基准实际测量的能力。
Hugging Face 发布 BenchMIRT 方法,基于多维 Item Response Theory 在单个提示词粒度上审计 LLM 评测基准实际测量的能力。
Berkeley AI Research 提出 SPEX(Spectral Explainer)及其改进版 ProxySPEX,基于信号处理与编码理论,将大语言模型中关键交互的发现转化为可求解的稀疏恢复问题,以远少于既有方法的消融次数识别有影响力的特征、数据与模型组件交互。
Berkeley AI Research 在 NeurIPS 2025 论文中提出一种直接评估和优化成像系统信息量的框架,基于互信息衡量测量数据区分物体的能力,并可在彩色摄影、射电天文、无透镜成像和显微镜四个领域预测解码器性能。