Microsoft Research 播客对话 Jennifer Neville:AI 在哪些地方会出错,失败又能教会我们什么
Microsoft Research 播客主持人 Chad Atalla 与 partner research manager Jennifer Neville 对谈,探讨 AI 系统在真实场景中的评测、超越传统 benchmark 时出现的"意外失败",以及当前模型与用户需求之间的对齐问题。
Microsoft Research 播客主持人 Chad Atalla 与 partner research manager Jennifer Neville 对谈,探讨 AI 系统在真实场景中的评测、超越传统 benchmark 时出现的"意外失败",以及当前模型与用户需求之间的对齐问题。
Amazon Quick 推出 Live Data in Apps,让 AI 构建的 Quick App 在用户每次打开时实时查询受治理的 Amazon Quick Sight 数据集(SPICE 与 Direct Query),而不再使用构建时的静态快照。
ChatGPT Work 推出 Data agent,用户可用自然语言连接公司数据、挖掘洞察并生成交互式仪表板。该功能面向所有用户开放。
Google Research 联合 HHMI Janelia、MRC 实验室分子生物学和剑桥大学等在《Cell》发布雄果蝇大脑与中枢神经系统的完整连接组,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今神经元数量最大的脑图谱。
Google Research 提出用于连续血糖监测(CGM)数据的基础模型 GlucoFM,采用双流编码器将低频血糖基线趋势与短期偏离分离开来,并在 109,066 小时无标签 CGM 数据上完成自监督预训练。
METR 研究显示,2026 年相较 2025 年,cURL、OpenSSL、Firefox、Microsoft 及 US NVD、OSV 等项目公开的漏洞数量大幅增加,AI 在网络安全领域带来显著加速;数学领域 arXiv 投稿翻倍但贡献难量化,AI 自身研究在七项基准上未见可衡量的加速。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名聚合的人流时空模式与 Gemini 等大语言模型的文本嵌入对齐,使地点表征同时编码静态身份与动态功能。
Google Research 发布面向表格数据分类与回归的零样本基础模型 TabFM,把表格预测重构为上下文学习任务,无需人工特征工程、超参调优或重复训练即可对新表做单次前向推理。
本期 Import AI 457 围绕三块内容展开。一是 SentinelLABS 披露 fast16.sys 病毒,它通过篡改 LS-DYNA 970、PKPM、MOHID 等高精度工程与仿真软件的浮点计算结果,使伊朗等核计划相关研究产出系统性偏差,被称为 Stuxnet 之前的早期软件武器原型。
Google Research 在 TMLR 发表论文,提出合成数据生成框架 Simula,采用 reasoning-first 方法从第一性原理构建数据集,无需种子数据,并将生成过程拆解为全局多样性、局部多样性、复杂度和质量校验四个独立可控维度。