跳到正文
10月12日 · 周一

最新精选

10月8日周四
  1. The Decoder79

    OpenAI 向 ChatGPT 全量推送 GPT-6,新增长交互界面能力与分层版本 GPT-6 Sol / GPT-6 Luna

    OpenAI 向 ChatGPT 全量推出 GPT-6,主打名为 Intelligent UI 的交互输出,会根据问题自动以图表、按钮、表单和小工具(如存款计算器、小游戏)替代纯文本回复,提问对比类内容会并排展示。

    推荐理由:原文给出 GPT-6 的输出形态变化和滚动上线安排,读者可以把它与 Gemini 的同类界面能力做横向对照。

10月6日周二
  1. Mistral AI80

    Mistral 发布 Mistral Large 4 公开预览,1T 总参 / 49B 激活参数原生多模态

    Mistral 今日上线 Mistral Large 4(昵称 le Chonk / ML4)公开预览 API,权重将于月底开源。ML4 是 1T 总参数、49B 激活参数的原生多模态模型,使用 3,800 颗 NVIDIA Grace Blackwell GPU 在 Mistral 欧洲自建数据中心训练,训练数据覆盖 160 多种语言。

    推荐理由:原文给出千亿级原生多模态大模型的关键参数与多项基准对比,读者可以据此判断它在开源生态中的相对位置。

10月1日周四
  1. Google DeepMind89

    Google DeepMind 发布 Gemini 4 Argon,主打长链路复杂任务与网络安全防御

    Google DeepMind 于 2026 年 9 月 30 日发布新一代前沿模型 Gemini 4 Argon,面向软件工程、企业知识工作(法律、金融)和防御性网络安全等复杂长链路场景,输出 token 上限提升至 1M,价格为输入 $2 / 百万 tokens、输出 $10 / 百万 tokens,缓存输入按输入价 95% 折扣计费。

    推荐理由:官方详细披露了 Gemini 4 Argon 在编码、企业知识工作和防御性网络安全上的能力提升与分阶段上线安排,便于评估其在真实工作流中的边界。

9月23日周三
  1. Latent Space82

    Claude Opus 5.5 发布,OpenAI 当日推出更便宜的 GPT-6 Sol 与 Luna

    Anthropic 发布 Claude Opus 5.5,定位以 Opus 档定价提供 Fable 5.1 级能力,比 Opus 5 快约 30%、便宜约 40%。

    推荐理由:同时梳理 Claude Opus 5.5 与 GPT-6 Sol/Luna 的能力、定价与第三方基准对照,便于读者快速对比两家在性价比与 agent 编码上的取舍。

9月16日周三
  1. Google DeepMind68

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

    Google DeepMind 发布两款实时语音模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,分别面向规模化部署与高复杂度任务,支持近实时视觉输入、对话中自动切换 97 种语言,并在后台执行工具与 API 调用。

    推荐理由:Gemini 3.8 Live 系列给出语音场景的多项基准成绩和并行推理能力,可与同类实时语音模型横向比较。

9月3日周四
  1. Google DeepMind77

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 两个变体。

    推荐理由:同一篇同时给出基础模型的推理与编码提升,以及面向可信防御者的网络安全专用变体,读者可对比两个变体的能力差异与获取渠道。

8月28日周五
  1. Google DeepMind67

    Google DeepMind 发布 Gemini Omni 1.1 Flash,面向开发者的可控生成视频能力

    Google DeepMind 推出 Gemini Omni 1.1 Flash,面向开发者提供场景延长、首尾帧插值、4K 放大、快速 360p 草稿和多模态视频参考等可控生成视频能力。

    推荐理由:原标题定位为能力介绍,文中给出了 Gemini Omni 1.1 Flash 的多项控制能力与代码示例,便于开发者评估可落地的视频生成工作流。

8月27日周四
  1. Google DeepMind72

    Google DeepMind 发布 Gemini 3.5 Transcribe 语音转写模型

    Google DeepMind 发布 Gemini 3.5 Transcribe 语音转写模型,强调对噪声、口头修正和自定义词汇的鲁棒处理。

    推荐理由:新模型在 WER 与延迟上给出可比基准,并公开两个具体 API 入口,便于评估它替代既有语音栈的成本。

8月14日周五
  1. Google DeepMind76

    Google DeepMind 发布 Gemini 3.7 Flash,面向编码与 Agent 的主力模型

    Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码与 Agent 的主力模型,距 Gemini 3.6 Flash 发布约三周。

    推荐理由:原文给出 Gemini 3.7 Flash 在编码与 Agent 任务上的基准提升和定价调整,可与 3.6 Flash 直接对比其工程取舍。

8月6日周四
  1. Google DeepMind80

    Google DeepMind 发布 WeatherNext Cyclones 并在 Nature 公开成果

    Google DeepMind 2026 年 8 月 6 日发文宣布,WeatherNext AI 模型在 Nature 公开论文中实现对气旋路径、强度和风结构的 SOTA 精度,平均为路径、强度和风结构预测带来超过 24 小时的提前量,相当于十年气象进展。

    推荐理由:给出了模型在路径与强度预测上的具体增益和开源入口,便于读者评估它对气象预报工作流的实际价值。

8月4日周二
  1. Microsoft Research79

    Microsoft Research 发布开源智能体框架 Orchard,主打可复用环境服务

    Microsoft Research 发布开源框架 Orchard,核心是 Kubernetes 原生的 Orchard Env 环境服务,可在软件工程、网页导航和个人助理三类任务上复用同一套基础设施,并支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练。

    推荐理由:把环境层抽象成可复用服务,并在真实部署 harness 内端到端训练,为开源智能体研究提供了可复现的工程基础。

7月30日周四
7月21日周二
7月17日周五
  1. Google DeepMind72

    Google DeepMind 发布面向网络安全场景的轻量模型 Gemini 3.5 Flash Cyber

    Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是一款基于 Gemini 3.5 Flash 微调的网络安全模型,用于在代码中快速发现、验证并修补漏洞。

    推荐理由:给出了 3.5 Flash Cyber 在 CyberGym、Big Sleep 和 Chrome 流水线等基准上的对比数据,可帮助评估其在漏洞挖掘场景中的实际取舍。

7月15日周三
7月2日周四
6月11日周四
  1. Google DeepMind73

    Google DeepMind 开源实验性扩散文本模型 DiffusionGemma,主打本地推理速度

    Google DeepMind 发布实验性开源模型 DiffusionGemma,采用 26B 总参数、激活 3.8B 参数的 MoE 架构,并基于 Gemma 4 系列与 Gemini Diffusion 研究改造而来。

    推荐理由:DiffusionGemma 用扩散生成替代逐 token 自回归,文章交代了它在本地推理下相对 Gemma 4 的速度与质量权衡。

6月9日周二
  1. Google DeepMind68

    Google DeepMind 发布 Gemini 3.5 Live Translate,支持 70 多种语言近实时语音翻译

    Google DeepMind 发布 Gemini 3.5 Live Translate 语音模型,可在 70 多种语言间进行近实时、流式的语音到语音翻译,保留说话者的语调、节奏和音高。

    推荐理由:Gemini 3.5 Live Translate 给出连续、流式的语音到语音翻译能力,并附 Google Meet、Google Translate 与 Gemini Live API 的入口。

  2. Google DeepMind70

    Google DeepMind 发布 Gemma 4 12B:无编码器统一架构多模态模型

    Google DeepMind 发布 Gemma 4 12B,定位 12B 档位的统一无编码器多模态模型,首次在中型尺寸上支持原生音频输入,可直接在配备 16GB VRAM 或统一内存的消费级笔记本上本地运行。

    推荐理由:原文给出 Gemma 4 12B 的无编码器多模态架构、16GB 本地运行门槛与 Apache 2.0 开源细节,读者可直接评估它在端侧多模态推理中的位置。

5月22日周五
  1. Mistral AI77

    Mistral 发布 Medium 3.5 模型,并在 Vibe 与 Le Chat 上线远程 Agent 与 Work mode

    Mistral 发布旗舰模型 Mistral Medium 3.5(公开预览),这是一款 128B dense 模型,256k 上下文,把指令跟随、推理和编程统一在同一套权重中。

    推荐理由:Mistral 把首个融合指令跟随、推理与编程的 128B 旗舰模型与云端远程 Agent 一起开放,展示了长时程任务在生产环境中的可行路径。