HP Inc. 与 OpenAI 启动 Frontier 战略合作
HP Inc. 与 OpenAI 启动 Frontier 战略合作,将 AI 部署到客户体验、软件开发和企业运营中。此次合作在双方既有 OpenAI Frontier 伙伴关系基础上升级扩展。
HP Inc. 与 OpenAI 启动 Frontier 战略合作,将 AI 部署到客户体验、软件开发和企业运营中。此次合作在双方既有 OpenAI Frontier 伙伴关系基础上升级扩展。
Google Research 提出一种新架构,把多 Token 预测(MTP)头接到已冻结的 Gemini Nano v3 模型上,在 Pixel 9 和 10 系列上实现开箱即用的加速。
推荐理由:Google 把 MTP 头接到冻结的 Gemini Nano v3 上,读者可了解端侧推测解码如何在内存受限下提速。
OpenAI 预告下一代模型 GPT-5.6 Sol,称其在编码、科学和网络安全方面具备更强能力,并搭配其最先进的安全栈。
推荐理由:OpenAI 官方预告下一代模型 GPT-5.6 Sol,读者可了解其在编码、科学与网络安全上的能力方向及配套安全栈。
Hugging Face 发布教程,介绍用一条 hf jobs run 命令在 HF Jobs 上启动私有、OpenAI 兼容的 vLLM 端点,按秒计费,无需自行配置服务器或 Kubernetes。
推荐理由:原文给出从启动到查询、清理的完整命令链路,读者可据此在 HF 基础设施上自建 OpenAI 兼容端点。
Google Research 提出线性弹性缓存,把页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小。在 Spanner 生产环境测试数月后,内存用量降低 15.5%,缓存未命中仅增加 5.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。该方法用浅层决策树预测页面 TTL,并已在 CIDR 发表。
OpenAI 发布新研究论文,展示 AI 智能体正在改变工作方式,能够承担更长、更复杂的任务,并在各类岗位中提升生产力。
Google Research 在 COLM 2026 发表的论文揭示,让模型生成推理轨迹能解锁原本无法召回的事实答案,即使问题只是单跳事实查询。研究在 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 上验证,发现两个机制:推理 token 充当计算缓冲,以及生成相关事实的"事实启动"效应。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前该能力仅以独立的 Gemini 2.5 computer use 模型形式提供。
推荐理由:Gemini 3.5 Flash 把 computer use 从独立模型并入主模型,读者可据此判断智能体跨平台自动化的落地路径。
NVIDIA 发布开源库 NeMo AutoModel,在 HuggingFace Transformers v5 之上加入 Expert Parallelism、DeepEP 融合 all-to-all 调度和 TransformerEngine 内核,微调 MoE 模型时训练吞吐提升 3.4-3.7 倍、GPU 显存减少 29-32%,且只需改动一行 import。
推荐理由:原文给出同一 from_pretrained() 接口下的吞吐与显存对比数据,读者可据此判断 MoE 微调的迁移成本。
Mistral 为 Connectors 推出多项新能力:按 workspace 或组织管理连接器访问权限的管理员控制、带连接器作用域的 API key、支持多账号登录的连接器均已 GA。
OpenAI 与 Broadcom 联合推出定制 AI 芯片 Jalapeño,专为 LLM 推理设计,目标是提升 AI 系统的性能、效率与扩展能力。
推荐理由:OpenAI 与 Broadcom 联合推出自研 LLM 推理芯片,可据此观察其推理算力自给的路径。
Hugging Face 与 Treble Technologies 发布首个开放、社区驱动的远场 ASR 基准 FFASR Leaderboard,覆盖 14 个模拟房间,并设有 Lab Measured 与 Lab Simulated 的 sim-to-real 验证轨道。
GPT-5 Pro 帮助免疫学家 Derya Unutmaz 解开了一个困扰三年的免疫学谜题,为 T 细胞行为提供了新见解。这一突破有望为癌症与自身免疫疾病研究提供支持。
OpenAI 正通过 Appia Foundation 参与构建先进 AI 的共享标准,支持评测框架、安全实践与全球合作。
Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言、10 个语系,可打包进单个容器完全自托管。该模型在 OlmOCRBench 上取得 85.20 的总体最高分,OmniDocBench 得分 93.07,独立标注者在 600 多份文档的盲评中平均 72% 的情况下更偏好其输出。
推荐理由:OCR 4 把边界框、块分类和置信度分数一并输出,读者可据此判断文档解析如何接入 RAG 与智能体流程。
Omio 正借助 OpenAI 构建对话式旅行体验,并推动产品开发提速、向 AI 原生公司转型。原文未披露具体模型版本、参数规模或性能数据。
Hugging Face 将 huggingface_hub 的发版周期从每 4 到 6 周缩短到每周一次,整套流程跑在单个 GitHub Actions workflow 上,由 OpenCode 驱动开放权重模型(当前为 Z.ai 的 GLM-5.2)起草 release notes 和 Slack 公告。
推荐理由:Hugging Face 公开了每周发版的完整 CI 流程,其中模型起草加确定性校验的循环可直接迁移到其他项目。
Google Chrome 团队开发者关系工程师 Thomas Steiner 在 Hugging Face 博客中,试验了拟议的 Cross-Origin Storage(COS)API 如何解决 Transformers.js 的跨源缓存重复问题。
PaddleOCR 发布新一代通用 OCR 模型家族 PP-OCRv6,已在 Hugging Face 上线,提供 tiny、small、medium 三档,参数量从 1.5M 到 34.5M。
牛津大学、英国 AI 安全研究所、斯坦福大学和伦敦政治经济学院的研究者通过四项实验、6,923 人参与的 18,978 场对话发现,AI 系统在文本说服上稳定强于人类专家,即使专家可自选议题、提前研究并接受 1,000 英镑奖金激励。
OpenAI 推出 Patch the Planet,这是 Daybreak 计划下的一项新举措,帮助开源维护者借助 AI 与专家审核发现、验证并修复漏洞。
Jason Liu 分享了他使用 OpenAI Codex 保存上下文、管理复杂项目,让工作不再局限于单次提示词。Codex 可帮助任务在单个 prompt 之外持续推进。
Hugging Face 博客介绍了用本地模型 Gemma 和 Qwen 在 agent harness 中对 OpenClaw 仓库的 issue 和 PR 做分类分诊的方案。
推荐理由:作者用本地模型加受限 shell 做 PR 分类,给出了可复用的 agentic classification 配方与实测对比数据。
三星电子在全球范围内向员工部署 ChatGPT Enterprise 和 Codex,这是 OpenAI 规模最大的企业 AI 落地项目之一。
Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,这些链交替穿插本地企业文档与公开网页信息。测试中智能体频繁泄露隐私,仅训练任务性能还会加剧泄露;其提出的 PA-DR 方法将严格链成功率从 48.7% 提升至 58.7%,并把答案/全信息泄露率从 34.0% 降至 9.9%。
OpenAI 为 ChatGPT Enterprise 新增用量分析与支出控制功能,帮助企业掌握成本并放心扩展 AI 应用。该功能面向企业客户,用于管理 ChatGPT 的使用开销。
OpenAI 发布说明,介绍 GPT-5.5 Instant 如何改进 ChatGPT 在健康与养生问题上的回答,包括更强的推理、更好的上下文理解、更清晰的表达,以及由医生参与设计的评估方式。
研究者使用 OpenAI 的推理模型辅助诊断罕见疾病,在先前未解决的病例中得出 18 例新诊断。该结果来自 OpenAI 官方发布,正文仅提供摘要,未披露所用模型的具体版本与研究方法细节。
推荐理由:OpenAI 推理模型在未确诊罕见病案例中给出 18 例新诊断,可了解推理模型在医疗诊断场景的落地方式。
Hugging Face 发布 agent-eval 工具,用于评测智能体使用某个库完成任务的全过程,而不只看最终答案,并以 transformers 为案例在模型、版本、任务三个维度上展开测试。
推荐理由:原文给出了一套可复用的工具基准方法,并展示了同一改动对不同规模模型效果相反的具体证据。
Hugging Face 在 PEFT 库中对比了 LoRA 之外的多种参数高效微调技术,并指出仅凭论文结果难以判断哪种技术最优。其统计显示,Hugging Face Hub 上提及单一 PEFT 技术的 20,834 个模型卡中有 20,509 个(98.4%)提到 LoRA,外部站点 10,000 个图像生成 checkpoint 中 7,111 个为 LoRA。
AWS 开源的 Strands Robots SDK(Apache 2.0)把 LeRobot 栈封装成 AgentTools,让一个 Strands 智能体在单次循环里完成仿真录制演示、推送 LeRobotDataset 到 Hub、跑策略、再以改一个关键字参数的方式部署到实体 SO-101,并通过 Zenoh 对等网格广播指令到多台机器人。
推荐理由:AWS 团队给出从 Hub 数据集到实体机器人的五步流程,可看到仿真与真机共用同一数据集格式的工程取舍。
OpenAI 与 Molecule.one 展示了一个使用 GPT-5.4 的近自主 AI 化学家,改进了药物制造中的一项关键反应,推进了药物化学研究。
推荐理由:OpenAI 与 Molecule.one 用 GPT-5.4 驱动的近自主 AI 化学家改进药物合成反应,可了解 AI 在化学研发中的落地方式。
智谱发布旗舰模型 GLM-5.2,主打长程任务能力,首次在 1M token 上下文上稳定支撑长程工作,并以 MIT 开源许可发布。模型引入 IndexShare 架构,每 4 层稀疏注意力共享同一 indexer,在 1M 上下文下将每 token FLOPs 降低 2.9 倍,同时改进 MTP 层使投机解码接受长度最高提升 20%。
推荐理由:GLM-5.2 把 1M 上下文与长程编码能力结合,并给出与闭源前沿模型的基准对比,可据此判断开源模型在长程任务上的位置。
Hugging Face 发布 Agentic Resource Discovery(ARD)规范的参考实现 Discover Tool,为数千个 Skills、ML 应用和 MCP Server 提供搜索入口。
推荐理由:Hugging Face 给出 ARD 规范的参考实现与 CLI、REST、MCP 三种接入方式,可据此判断智能体能力发现如何落地。
OpenAI 发布 LifeSciBench,一个由专家撰写并评审的基准,用于评估 AI 系统处理真实生命科学研究任务与决策的能力。该基准聚焦现实科研场景,而非抽象题目。
Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Camden、Dorset 地方规划部门合作,开发基于 Gemini 的 AI 规划审批原型,目标是把住户规划申请的处理时间缩短 50%。
Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率栅格地图转为可操作的树篱、石墙和树丛清单,覆盖英国超 13 万平方公里。
Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部构建和管理高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层,即使对齐不完美也能提供保障。
推荐理由:DeepMind 公开内部 AI Control Roadmap,给出把智能体当作潜在内部威胁的分级防护思路,可了解前沿实验室如何做系统级安全。
OpenAI 推出 Deployment Simulation,一种在模型部署前预测其行为的方法,使用真实对话数据来提升安全性和评估准确性。
推荐理由:OpenAI 提出用真实对话数据在发布前模拟部署,读者可了解其安全评估思路的调整方向。
英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,认为“对齐尚未走上正轨”,计划两年内扩至 40-80 名全职员工,初期募资 1 亿至 1.5 亿美元,研究方向涵盖可扩展监督、学习理论、博弈论与 personas。