Google Research 提出 ToolGrad:用文本“梯度”高效生成工具调用数据集
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据生成范式,先构造真实工具调用链再反向标注用户提示词,在 16k+ API 的 ToolBench 上以更低成本生成更复杂的长链路数据,通过率接近 100%。
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据生成范式,先构造真实工具调用链再反向标注用户提示词,在 16k+ API 的 ToolBench 上以更低成本生成更复杂的长链路数据,通过率接近 100%。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需离开应用即可审查、运行并预览 AI 智能体生成的代码变更。
César de la Fuente 的实验室利用 Codex 和 ChatGPT 在现存与已灭绝生物的基因组中搜寻抗菌候选分子,以对抗耐药性感染。
OpenAI 宣布 ChatGPT Work 中的 Data agent 面向所有人开放,可连接公司数据、发现洞察,并用自然语言让 AI 构建交互式仪表盘。
推荐理由:OpenAI 官方给出 ChatGPT Work 中 Data agent 的定位,读者可据此了解企业数据接入与看板生成的新入口。
Cloudera 与 Mistral 宣布合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。合作还支持企业用专有数据在受控环境中训练自有模型,覆盖 Cloudera 平台上 30 exabytes 的客户管理数据。
OpenAI 推出面向金融服务的 ChatGPT,内置金融数据并接入 GPT-6 Astra,用于研究、建模和生成可直接交付客户的材料。
推荐理由:官方给出金融场景的产品定位与内置数据、模型组合,可据此判断 ChatGPT 在金融工作流中的切入点。
OpenAI 与 GSA 合作,向符合条件的美国联邦、州、地方和部落政府提供 0 美元许可费、用量费用减半以及扩展的网络防御支持。
推荐理由:OpenAI 与美国 GSA 合作向各级政府提供零许可费和半价用量,可了解其面向公共部门的定价与安全支持安排。
TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,rank-1 adapter 仅几 MB,可通过挂载到各 Job 的 Storage Bucket 传输,无需 NCCL。
Hugging Face 发布 Workflow1111,用 Gradio Workflow 把 AUTOMATIC1111 的大部分功能重建为一张工作流画布,由 11 条媒体管线和 73 个节点组成,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 与图生视频。
推荐理由:原文给出用 Gradio Workflow 重建 A1111 全部管线的节点构成与运行方式,可据此判断无 GPU 搭建多模型工作流的可行性。
OpenAI 发布 Agents API,这是一个由 Codex harness 驱动的托管服务,用于构建和上线云端智能体。该服务支持编排、长时间运行的会话以及工具调用。
推荐理由:OpenAI 官方给出 Agents API 的托管定位与 Codex harness 编排能力,可据此判断云端智能体的搭建方式。
Paul Christiano 加入 OpenAI Foundation 董事会及其安全与安保委员会。他在 AI 对齐、安全与标准方面拥有丰富经验。
OpenAI 的 Chris Lehane 主张,AI 能力越强,越需要更强的安全证据、共享标准和持久的政策行动,并强调政策窗口仍然敞开、必须抓紧行动。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。团队先搭建数值对齐校验框架,再用 Vibe CLI 启动上百个智能体解析调用树并生成文档,最终采用规划、编码、测试、审查加人工审核的分模块工作流。
推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 77 的完整流程,读者可参考其数值对齐与人工审核节点的做法。
OpenAI 发布 GPT-6 Astra,称其为面向企业的最强模型,具备高级推理、computer use 以及更强的写作与设计判断能力。
推荐理由:OpenAI 官方公布 GPT-6 Astra 的定位与三项能力方向,可据此了解其面向企业场景的升级重点。
MIT 研究人员使用 GPT-5.6 Sol 配合 Codex,自主运行量子计算实验、分析结果并校准量子比特。该案例展示了 GPT-5.6 Sol 在量子计算实验流程中的实际应用方式。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组中 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上,今日起通过网站门户、AlphaGenome API 和 Google Antigravity 中的 skill 向学术研究免费开放。
推荐理由:DeepMind 把 AlphaGenome 的预测预计算成覆盖全基因组的可检索图谱,读者可了解其数据规模与开放方式。
OpenAI 探讨更强且更实惠的 AI 如何拓展个人与企业可完成的工作,并让增长变得更经济。文章聚焦能力提升与成本下降这两条主线,说明其如何扩大可及的工作范围。
Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,由三星电子领投,Scaleup Europe Fund 与 PSG Equity 联合领投。公司称这是欧洲科技企业完成的最大规模股权融资,资金将用于扩展前沿研究、算力与商业增长。Mistral 目前业务覆盖 20 个国家,服务 125 家以上全球企业,包括 Airbus、ASML 和 HSBC。
推荐理由:Mistral 完成欧洲最大股权融资,读者可了解其主权开源全栈路线与投资方结构。
OpenAI 发布 ChatGPT Images 2.5,可将想法、草图和参考照片转化为更个性化、更精致的图像,更贴近用户原本的构想。
推荐理由:官方给出 ChatGPT Images 2.5 的输入类型与输出定位,可据此了解图像生成能力这次的调整方向。
OpenAI 正在扩大对新闻业的支持,面向学生、教育工作者、记者和新闻机构提供工具、培训与合作项目。该计划覆盖从课堂到新闻编辑室的多个环节。
OpenAI 分享了一份 AI 生成的 Navier–Stokes 千禧年大奖难题解答,包含一份书面说明和一份 Lean 形式化证明。
OpenAI 开放 500 万美元资助计划申请,支持关于生成式 AI 如何影响青少年发展、福祉与安全的独立研究。
1Password 的工程师使用 Codex 快速构建新功能和内部工具,在维持严格安全策略的同时达到生产可用状态,工程效率提升 21%。
OpenAI 联合 AIRPPU 和 WAN-IFRA 启动一项 AI 项目,帮助乌克兰新闻机构提升创新能力、韧性与独立新闻业。该项目面向乌克兰新闻组织,具体工具、规模与上线时间未在原文中披露。
OpenAI 的 Jakub Pachocki 反思日益强大的 AI 及保持其对齐的难题,呼吁加强安全防护并推动国际协调。
OpenAI 披露内部数据,展示编码智能体正在重塑 AI 研究流程。文章聚焦智能体使用情况、实验速度、任务复杂度与研究加速等早期数据。
GitHub 发布研究预览 Project HydraFusion,在 GitHub Copilot CLI 中通过运行时编排多个提供商的模型,自动选择 Single、Cascade、Critique 三种执行模式来平衡质量、成本与延迟。
推荐理由:GitHub 官方给出 HydraFusion 的三种编排模式与三个基准上的质量成本对照,可据此判断多模型编排在编码任务中的取舍。
Google Research 用 UK Biobank 欧洲人群与 Biobank Japan 近 20 万日本人群数据,在 8 项临床性状上评估多基因风险评分(PRS)的跨人群迁移效果。结果显示,目标人群样本达 15k 以上时,专用模型优于混合欧洲数据训练;遗传相关性高的性状可继续受益于欧洲数据至 25-40k+ 样本,而 HDL、LDL 和血糖等高度人群特异性性状受益有限。
Google 与 HHMI Janelia 及剑桥大学等合作者发布雄性果蝇脑与中枢神经系统的完整连接图谱,相关论文发表于 Cell,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。
推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的脑图谱,读者可了解 AI 在连接组学中的具体作用。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进、最准确的全球天气模型,直接学习实时卫星观测数据,可每小时生成一次预报。
推荐理由:原文给出分辨率、更新频率与降水精度提升幅度,读者可据此判断 AI 天气预报在 Google 产品中的实际可用程度。
OpenAI 推出 Daybreak for Frontline Defenders,承诺投入 10 亿美元,为关键服务扩大前沿网络 AI 的使用权限,并提供培训与支持。
Hugging Face 推出 NeoMME 系列多语言多模态编码器,含 260M 和 800M 两个规模,用单个双向 Transformer 同时处理文本 token 与 32×32 图像 patch,无需独立视觉塔或因果语言模型。
Playco 借助 GPT-6 Astra,从一个灰盒基础版本构建了三款主题游戏原型,人工修复量比使用上一代模型减少 50%。
Legora 借助 GPT-6 Astra 在数分钟内审阅了 41 份文档,找出了全部四处预设错误,并在该财务审阅工作流中把性能提升近 40%。
OpenAI 发布 GPT-6 Astra,称其为目前最智能、对齐程度最高的模型,在计算机操作、编码、网络安全和科学方面具备 SOTA 能力。
推荐理由:OpenAI 官方发布 GPT-6 Astra,可据此了解新模型在计算机操作、编码、网络安全与科学上的能力定位。
一份公开教程用 TRL 的 GRPO 对 LFM2.5-350M 做约 500 样本、100 步的微调,在 IFStruct 基准上把通过率从 22.6% 提升到 29.7%。训练可在免费 Colab 或 Kaggle GPU 上完成,评测则通过 llama.cpp 在本地 MacBook 上运行,代码已开源在 GitHub。
Hugging Face 发布 funes,一个为 Claude Code、Codex、pi 和 Hermes 等编码智能体提供持久记忆的本地层,从本机已有会话构建索引,一条命令即可接入。
推荐理由:funes 把编码智能体的历史会话变成可检索的本地记忆,读者可据此判断跨机器、跨智能体协作的可行路径。
Hugging Face 用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型画水彩的想法,模型通过 p5.brush 写出约 150 行 JavaScript 来作画。
OpenAI 发布 GPT-6 Astra 安全概览,称其是已广泛部署的最强模型,也是首个在 Preparedness Framework 下达到网络安全能力 Critical 级别的模型。
推荐理由:OpenAI 官方披露 GPT-6 Astra 在 Preparedness Framework 下首次达到网络安全能力 Critical 级别,可了解其安全分级依据。
Google 推出 Fairwind Program,限量向 Google Cloud 客户、政府机构和网络安全合作伙伴开放其最先进的网络防御能力,首批提供 Gemini 3.8 Flash Cyber 模型配合 CodeMender 工具链,用于自主发现、验证并修复漏洞。
推荐理由:Google 把前沿网络安全模型以限量计划形式开放给政府和关键基础设施,读者可了解其能力边界与准入条件。