Hugging Face 发布 Transformers v5.0.0rc-0
Hugging Face 发布 Transformers v5.0.0rc-0,距 v4 首个候选版已五年,如今该库每天经 pip 安装超 300 万次,累计安装量超 12 亿次。
推荐理由:官方给出 v5 在模型定义、训练、推理与量化上的重构方向,可据此判断生态工具链的兼容变化。
Hugging Face 发布 Transformers v5.0.0rc-0,距 v4 首个候选版已五年,如今该库每天经 pip 安装超 300 万次,累计安装量超 12 亿次。
推荐理由:官方给出 v5 在模型定义、训练、推理与量化上的重构方向,可据此判断生态工具链的兼容变化。
OpenAI 披露一起涉及 Mixpanel 的安全事件,波及有限的 API 分析数据,但 API 内容、凭证和支付信息均未泄露。OpenAI 同时说明了事件经过及正在采取的用户保护措施。
OpenAI 为 ChatGPT Enterprise、ChatGPT Edu 和 API Platform 扩展数据驻留能力,符合条件的客户可将静态数据存储于所在区域。
Google DeepMind 介绍一项由 AlphaFold 参与的研究,科学家解析了“坏胆固醇”关键蛋白 apoB100 的结构。密苏里大学研究者先用冷冻电镜拍摄 LDL 颗粒图像,再由物理学家用 AlphaFold 生成原子级结构预测并与电镜数据比对,最终得到笼状外壳和带状结构的模型。该结构有望帮助更精准地预防、诊断和治疗高胆固醇与动脉粥样硬化性心血管疾病。
推荐理由:AlphaFold 与冷冻电镜结合解析 apoB100 结构,读者可了解 AI 在结构生物学中的具体用法。
JetBrains 正在将 GPT-5 集成到旗下编程工具中,帮助数百万开发者更快地设计、推理和构建软件。
Hugging Face 发布博客,从 attention 机制与 KV caching 出发,通过优化吞吐量推导出 continuous batching。该方法通过并行处理多个对话、完成即换出,来提升高负载场景下的推理性能。文中指出 attention 是 token 间唯一交互之处,其计算量随序列长度呈平方增长。
Hugging Face Diffusers 官方博客宣布支持 FLUX.2,并给出基于 diffusers/FLUX.2-dev-bnb-4bit 仓库的完整推理示例。
推荐理由:Diffusers 官方给出 FLUX.2 的加载与推理代码,读者可据此判断本地部署所需的显存与量化方案。
Hugging Face 分享构建 SOTA 深度研究智能体的经验:七个月前其首版架构因假设过于复杂,在新一代模型到来后成为瓶颈,被迫推倒重建。团队转向更简化的编排逻辑并依赖模型自主性,同时借助 Tavily Advanced Search 在工具侧完成上下文工程,只返回最相关内容块以降低幻觉与延迟。
OVHcloud 正式加入 Hugging Face Hub 的 Inference Providers 生态,用户可直接在模型页调用 gpt-oss、Qwen3、DeepSeek R1、Llama 等开源模型。
Google DeepMind 宣布支持美国白宫 Genesis 计划,与美国能源部合作,为全部 17 个国家实验室提供前沿 AI for Science 模型和智能体工具的加速访问通道,即日起从 Google Cloud 上的 AI co-scientist 开始。
推荐理由:Google DeepMind 与 DOE 合作开放前沿科研模型给 17 个国家实验室,可了解 AI for Science 的落地路径。
OpenAI 在 ChatGPT 中推出购物研究功能,帮助用户浏览、比较和发现商品,并生成个性化买家指南以简化决策。该功能由 OpenAI 官方发布,目前材料仅给出功能定位,未披露具体入口和上线范围。
推荐理由:OpenAI 官方给出 ChatGPT 购物研究功能的定位,读者可据此了解它在选购决策环节承担的角色。
UCLA 教授 Ernest Ryu 与 GPT-5 合作解决了一个优化理论中的关键问题,展示了 AI 在加速数学发现中的作用。
Google 设计了一个轻量级线性回归模型,预测某充电站在未来若干分钟后充电端口可用的概率,用于将充电站纳入 EV 导航路线以缓解续航焦虑。模型仅以一天中各小时作为特征,在 30 至 60 分钟预测区间、100 个随机站点上评估,性能超过"保持当前状态"这一强基线,主要优势在于识别高占用率变化的关键时刻。
Hugging Face 的 Open ASR Leaderboard 新增多语言与长音频转录赛道,并发布基于 60+ 模型的 ASR 趋势预印本。
Hugging Face TRL 正式集成 RapidFire AI,用户可发现、安装并运行它来并发比较多组微调与后训练配置,无需大幅改代码,也不额外增加 GPU 需求。
推荐理由:官方给出与 TRL 的集成方式和并发调度机制,读者可据此判断多配置微调实验的提速空间。
Google DeepMind 宣布在 Gemini 应用中上线图像验证功能,用户上传图片并提问是否由 Google AI 生成或编辑,Gemini 会检测 SynthID 水印并结合自身推理给出判断。
推荐理由:Google 把 SynthID 水印检测直接放进 Gemini 应用,读者可了解 AI 图像溯源在消费端产品的落地方式。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,面向开发者提供影棚级图像生成与编辑,已在 Google AI Studio 和 Vertex AI 以付费预览形式逐步开放。
推荐理由:官方给出新图像模型的分辨率、文本渲染与搜索接地能力,以及 Adobe、Figma 等接入情况,便于判断其与上一代的取舍。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,主打更准确的图像内文字渲染、多语言生成与更强的世界知识。
推荐理由:官方给出 Nano Banana Pro 的能力边界与各产品上线节奏,可据此判断图像生成与编辑的可用范围。
OpenAI 与富士康达成合作,将在美国设计并制造下一代 AI 基础设施硬件。双方将共同开发多代数据中心系统,强化美国本土供应链,并在美国国内生产关键组件,以加速先进 AI 基础设施建设。
OpenAI 联合 DoorDash、SCORE 及本地机构,帮助 1,000 家小企业用 AI 开展业务。这项名为 Small Business AI Jam 的计划为小微企业主提供实操工具和培训,帮助他们提升竞争力并实现增长。
OpenAI 公布首批研究案例,展示 GPT-5 在数学、物理、生物学和计算机科学领域加速科学进展。这些实验呈现 AI 与研究人员如何协作生成证明、发现新见解,并改变科学发现的速度。
AnyLanguageModel 发布,这是一个 Swift 包,可作为 Apple Foundation Models 框架的 drop-in 替代,只需把 import FoundationModels 换成 import AnyLanguageModel 即可切换模型提供方。
Mistral AI 宣布与 SAP 建立多年合作,将自家模型集成进 SAP 的 AI Foundation,共同为德国及欧洲开发主权 AI 技术栈和行业解决方案。Mistral AI 同时与 Helsing 合作加速面向国防与安全应用的 vision-language-action 模型研发,并将在未来数月内在德国开设办公室、大幅扩充本地团队。
OpenAI 与独立专家合作评估前沿 AI 系统,借助第三方测试强化安全保障、验证防护措施,并提升模型能力与风险评估的透明度。
OpenAI 发文阐述 evals 如何帮助企业定义、衡量并改进 AI 表现,从而降低风险、提升生产力并形成战略优势。
Google Research 介绍了一个端到端语音到语音翻译(S2ST)模型,可在原说话人音色下实时翻译,延迟仅 2 秒,而现有级联方案通常有 4–5 秒延迟并会累积误差。
推荐理由:Google 端到端语音翻译把延迟压到 2 秒并保留原说话人音色,可对照级联方案的误差累积问题。
OpenAI 与 Target 达成合作,将在 ChatGPT 中推出全新 Target 应用,提供个性化购物与更快捷的结账体验。Target 还将扩大 ChatGPT Enterprise 的使用范围,以提升生产力和顾客体验。
ServiceNow 的 SLAM Lab 将 15B 推理模型 Apriel-Nemotron-15B-Thinker 蒸馏改造为 Mamba 混合架构,旗舰版 Apriel-H1-15b-Thinker-SFT 在 50 层中替换 30 层为 Mamba。
OpenAI 发布 GPT-5.1-Codex-Max 系统卡,说明该模型在模型层与产品层部署的安全措施。模型层包括针对有害任务和提示词注入的专项安全训练,产品层则涵盖智能体沙箱与可配置网络访问。
全球制造商 Scania 正借助 ChatGPT Enterprise 在全体员工中规模化应用 AI。该公司通过按团队推进的 onboarding 流程和严格的 guardrails,提升了生产力、质量与创新能力。
OpenAI 发布 ChatGPT for Teachers,这是一个具备教育级隐私和管理员控制的安全工作区。该版本对美国 K-12 认证教育工作者免费开放,持续至 2027 年 6 月。
Google DeepMind 发布 Gemini 3 Pro,称其在主要 AI 基准上超过此前版本,编码与智能体任务表现优于 2.5 Pro。模型已在 Google AI Studio 和 Vertex AI 以预览形式开放,200k token 以内输入 $2/百万 token、输出 $12/百万 token,并在 Google AI Studio 免费提供但有限速。
推荐理由:官方给出 Gemini 3 Pro 的基准成绩、API 定价与 Antigravity 平台入口,可据此判断其编码与智能体能力落点。
Google DeepMind 在新加坡开设新研究实验室,聚焦推进 Gemini 核心能力与亚太语言文化包容性研究,其亚太团队过去一年已扩大一倍以上。新实验室将与当地政府、企业和学术机构合作,此前已与 AI Singapore 基于 Gemma 3 多模态能力推出 SEA-LION v4,并与 A*STAR 用 AlphaFold 推进帕金森病研究。
Google DeepMind 发布 Gemini 3,称其为自家最智能的模型,首发 Gemini 3 Pro 预览版,并同步上线 Gemini 应用、Search 的 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新的智能体开发平台 Google Antigravity。
推荐理由:官方一次性给出 Gemini 3 Pro 与 Deep Think 的基准成绩、产品落地范围和开放入口,可据此判断能力代际变化。
Google 发布智能体开发平台 Antigravity,已开放免费公开预览,支持 macOS、Linux 和 Windows。该平台在传统 AI IDE 的 Editor 视图之外新增面向智能体的 Manager 视图,可并行编排多个工作区中的智能体,并通过任务列表、实现计划、截图和浏览器录制等 Artifacts 呈现工作过程。
推荐理由:Google 把 IDE 拆成同步编辑器与异步 Agent Manager 两层,读者可据此判断智能体编程工具的产品形态走向。
Google 推出生成式 UI 实现,由模型按提示词自动生成网页、游戏、工具等交互界面,而非渲染静态预设界面。该能力以 dynamic view 和 visual layout 两个实验在 Gemini app 上线,并集成到 Google Search 的 AI Mode,基于 Gemini 3 Pro 与工具调用、系统指令、后处理三部分实现。
推荐理由:Google 把生成式 UI 落到 Gemini 与搜索 AI Mode,读者可了解其实现路径与人工评测偏好结果。
OpenAI 与 Intuit 达成金额超 1 亿美元的多年合作,计划在 ChatGPT 中推出 Intuit 应用体验,并扩大 Intuit 对 OpenAI 前沿模型的使用,用于驱动个性化财务工具。
Google DeepMind 与 Google Research 发布 WeatherNext 2,称其生成预报速度比前代快 8 倍,分辨率最高可达 1 小时。
OpenAI 被 Gartner 2025 生成式 AI 模型供应商创新指南评为"新兴领导者",该认可反映其企业业务势头,目前已有超过 100 万家公司使用 ChatGPT 构建应用。
Hugging Face 的 kernels 库支持用 kernel-builder 构建并分享 ROCm 内核,可集成进 PyTorch 工作流。指南以 RadeonFlow GEMM 内核为例,该内核针对 AMD Instinct MI300X 优化,采用 FP8 e4m3fnuz 格式与分块缩放,曾获 AMD Developer Challenge 2025 大奖。