OpenAI 向 ChatGPT 全量推送 GPT-6,新增长交互界面能力与分层版本 GPT-6 Sol / GPT-6 Luna
OpenAI 向 ChatGPT 全量推出 GPT-6,主打名为 Intelligent UI 的交互输出,会根据问题自动以图表、按钮、表单和小工具(如存款计算器、小游戏)替代纯文本回复,提问对比类内容会并排展示。
推荐理由:原文给出 GPT-6 的输出形态变化和滚动上线安排,读者可以把它与 Gemini 的同类界面能力做横向对照。
OpenAI 向 ChatGPT 全量推出 GPT-6,主打名为 Intelligent UI 的交互输出,会根据问题自动以图表、按钮、表单和小工具(如存款计算器、小游戏)替代纯文本回复,提问对比类内容会并排展示。
推荐理由:原文给出 GPT-6 的输出形态变化和滚动上线安排,读者可以把它与 Gemini 的同类界面能力做横向对照。
Mistral 今日上线 Mistral Large 4(昵称 le Chonk / ML4)公开预览 API,权重将于月底开源。ML4 是 1T 总参数、49B 激活参数的原生多模态模型,使用 3,800 颗 NVIDIA Grace Blackwell GPU 在 Mistral 欧洲自建数据中心训练,训练数据覆盖 160 多种语言。
推荐理由:原文给出千亿级原生多模态大模型的关键参数与多项基准对比,读者可以据此判断它在开源生态中的相对位置。
Google DeepMind 于 2026 年 9 月 30 日发布新一代前沿模型 Gemini 4 Argon,面向软件工程、企业知识工作(法律、金融)和防御性网络安全等复杂长链路场景,输出 token 上限提升至 1M,价格为输入 $2 / 百万 tokens、输出 $10 / 百万 tokens,缓存输入按输入价 95% 折扣计费。
推荐理由:官方详细披露了 Gemini 4 Argon 在编码、企业知识工作和防御性网络安全上的能力提升与分阶段上线安排,便于评估其在真实工作流中的边界。
Anthropic 发布 Claude Opus 5.5,定位以 Opus 档定价提供 Fable 5.1 级能力,比 Opus 5 快约 30%、便宜约 40%。
推荐理由:同时梳理 Claude Opus 5.5 与 GPT-6 Sol/Luna 的能力、定价与第三方基准对照,便于读者快速对比两家在性价比与 agent 编码上的取舍。
Google DeepMind 发布两款实时语音模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,分别面向规模化部署与高复杂度任务,支持近实时视觉输入、对话中自动切换 97 种语言,并在后台执行工具与 API 调用。
推荐理由:Gemini 3.8 Live 系列给出语音场景的多项基准成绩和并行推理能力,可与同类实时语音模型横向比较。
Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 两个变体。
推荐理由:同一篇同时给出基础模型的推理与编码提升,以及面向可信防御者的网络安全专用变体,读者可对比两个变体的能力差异与获取渠道。
Google DeepMind 推出 Gemini Omni 1.1 Flash,面向开发者提供场景延长、首尾帧插值、4K 放大、快速 360p 草稿和多模态视频参考等可控生成视频能力。
推荐理由:原标题定位为能力介绍,文中给出了 Gemini Omni 1.1 Flash 的多项控制能力与代码示例,便于开发者评估可落地的视频生成工作流。
Google DeepMind 发布 Gemini 3.5 Transcribe 语音转写模型,强调对噪声、口头修正和自定义词汇的鲁棒处理。
推荐理由:新模型在 WER 与延迟上给出可比基准,并公开两个具体 API 入口,便于评估它替代既有语音栈的成本。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码与 Agent 的主力模型,距 Gemini 3.6 Flash 发布约三周。
推荐理由:原文给出 Gemini 3.7 Flash 在编码与 Agent 任务上的基准提升和定价调整,可与 3.6 Flash 直接对比其工程取舍。
Google DeepMind 2026 年 8 月 6 日发文宣布,WeatherNext AI 模型在 Nature 公开论文中实现对气旋路径、强度和风结构的 SOTA 精度,平均为路径、强度和风结构预测带来超过 24 小时的提前量,相当于十年气象进展。
推荐理由:给出了模型在路径与强度预测上的具体增益和开源入口,便于读者评估它对气象预报工作流的实际价值。
Microsoft Research 发布开源框架 Orchard,核心是 Kubernetes 原生的 Orchard Env 环境服务,可在软件工程、网页导航和个人助理三类任务上复用同一套基础设施,并支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练。
推荐理由:把环境层抽象成可复用服务,并在真实部署 harness 内端到端训练,为开源智能体研究提供了可复现的工程基础。
Google DeepMind 发布面向机器人的 embodied reasoning 模型 Gemini Robotics ER 2,相比 ER 1.6 在视频理解、任务编排和多机器人协作上带来升级。
推荐理由:原文在视频引导后给出模型能力、可用性与接入入口,读者可以据此判断该模型会如何影响机器人开发流程。
Google DeepMind 发布三款 Gemini 模型:3.6 Flash 在保持更低价格(输入 $1.50/1M token、输出 $7.50/1M token)的同时相对 3.5 Flash 减少 17% 输出 token。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是一款基于 Gemini 3.5 Flash 微调的网络安全模型,用于在代码中快速发现、验证并修补漏洞。
推荐理由:给出了 3.5 Flash Cyber 在 CyberGym、Big Sleep 和 Chrome 流水线等基准上的对比数据,可帮助评估其在漏洞挖掘场景中的实际取舍。
Thinking Machines 在 Hugging Face 开源多模态模型 Inkling,全量版为 975B 总参 / 41B 激活参数的 decoder-only MoE。
Mistral AI 发布 Leanstral 1.5,这是一个 Apache-2.0 开源的形式化证明模型,总参数 119B、活跃参数 6B。
推荐理由:用开源 6B 活跃参数模型在 miniF2F、PutnamBench、FATE-H/X 等形式化基准上给出新 SOTA,并配套开源 FLTEval 与代码验证用例。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用 26B 总参数、激活 3.8B 参数的 MoE 架构,并基于 Gemma 4 系列与 Gemini Diffusion 研究改造而来。
推荐理由:DiffusionGemma 用扩散生成替代逐 token 自回归,文章交代了它在本地推理下相对 Gemma 4 的速度与质量权衡。
Google DeepMind 发布 Gemini 3.5 Live Translate 语音模型,可在 70 多种语言间进行近实时、流式的语音到语音翻译,保留说话者的语调、节奏和音高。
推荐理由:Gemini 3.5 Live Translate 给出连续、流式的语音到语音翻译能力,并附 Google Meet、Google Translate 与 Gemini Live API 的入口。
Google DeepMind 发布 Gemma 4 12B,定位 12B 档位的统一无编码器多模态模型,首次在中型尺寸上支持原生音频输入,可直接在配备 16GB VRAM 或统一内存的消费级笔记本上本地运行。
推荐理由:原文给出 Gemma 4 12B 的无编码器多模态架构、16GB 本地运行门槛与 Apache 2.0 开源细节,读者可直接评估它在端侧多模态推理中的位置。
Mistral 发布旗舰模型 Mistral Medium 3.5(公开预览),这是一款 128B dense 模型,256k 上下文,把指令跟随、推理和编程统一在同一套权重中。
推荐理由:Mistral 把首个融合指令跟随、推理与编程的 128B 旗舰模型与云端远程 Agent 一起开放,展示了长时程任务在生产环境中的可行路径。