跳到正文
10月12日 · 周一

最新精选

10月8日周四
  1. Microsoft Research78

    微软研究院发布 Agent Lightning v1.0:约 3500 行代码的轻量级智能体强化学习框架

    微软研究院发布 Agent Lightning v1.0,提出 Harnessed Agentic RL 范式,让部署中使用的 agent harness 直接参与强化学习训练,无需在训练框架内重新实现 agent。

    推荐理由:把部署侧 agent harness 直接接入 RL 训练,并用 Qwen3.5-9B 给出可复现的 SWE-bench Verified 提升结果,适合评估智能体训练链路复用方式。

10月7日周三
10月4日周日
  1. Hugging Face Blog70

    微软与 Hugging Face 联合发布 ThinkingBox:基于后端状态评估 AI 智能体的一致性

    微软与 Hugging Face 联合发布 ThinkingBox 与 ThinkingBox-Bench,通过 507 个有状态业务工作流、每个任务跑 20 次,按数据库终态和副作用而非工具调用来给 AI 智能体打分。

    推荐理由:原文把评估重点从工具调用转向数据库终态,并用 20 次重复把“能做一次”和“能做稳”拆开看,读者可以据此调整自己的智能体评测口径。

10月3日周六
  1. The Decoder80

    Ataraxos击败Stratego史上最强者,攻下人类在棋类上的最后堡垒之一

    AI 系统 Ataraxos 在不完美信息棋类 Stratego 中以有效胜率 85% 击败四届世界冠军 Niemeijer,并在 2025 Stratego 世界冠军赛表演场中以 40 场赢 38 场战胜多名赛会选手。

    推荐理由:原文给出 Ataraxos 与 DeepNash 在 Stratego 上的算力差距与对最强人类选手的胜率,可用于判断不完美信息博弈 AI 的真实进展。

7月23日周四
  1. Google Research64

    Google Research 发布 SymptomAI:面向日常症状问诊的对话式 AI 智能体研究

    Google Research 发布论文 SymptomAI,基于 Gemini Flash 2.0 构建 5 个不同问诊策略的对话式 AI 智能体,并在 n=13,917 的全国随机研究中让参与者描述症状、两周后回报临床诊断结果。

    推荐理由:原文给出了 13,917 人随机对照的诊断准确率与可穿戴生理信号对照方法,读者可据此判断该方法在真实人群中的迁移潜力。

7月9日周四
  1. Google Research63

    Google Research 提出 SensorFM:用万亿分钟可穿戴数据训练通用传感器基础模型

    Google Research 推出 SensorFM,一个面向可穿戴健康数据的通用传感器基础模型。它基于 500 万名受试者在 2024 年 9 月至 2025 年 9 月间产生的超过一万亿分钟、34 项一分钟级特征进行自监督预训练,覆盖心率、血氧、睡眠、运动等模态,并通过 Adaptive and Inherited Masking (AIM) 直接处理真实数据缺失。

    推荐理由:原文给出了 SensorFM 在可穿戴健康数据上的预训练规模、下游迁移表现和与人工真实标签的对比,读者可以据此了解通用传感器基础模型在该领域的能力边界。

已经到底了