Hugging Face 发布 VAKRA:评测 AI 智能体推理、工具调用与失败模式的可执行基准
Hugging Face 推出 VAKRA,一个面向企业级环境的工具接地可执行基准,用于评测 AI 智能体的组合推理与多步工作流执行能力。VAKRA 提供 8,000+ 本地托管 API、覆盖 62 个领域并配有领域文档,任务需 3-7 步推理链,包含 API Chaining、Tool Selection、Multi-Hop Reasoning 等四项任务,模型整体表现不佳。
Hugging Face 推出 VAKRA,一个面向企业级环境的工具接地可执行基准,用于评测 AI 智能体的组合推理与多步工作流执行能力。VAKRA 提供 8,000+ 本地托管 API、覆盖 62 个领域并配有领域文档,任务需 3-7 步推理链,包含 API Chaining、Tool Selection、Multi-Hop Reasoning 等四项任务,模型整体表现不佳。
OpenAI 更新 Agents SDK,新增原生沙箱执行和模型原生 harness,帮助开发者在文件与工具之间构建安全、长时间运行的智能体。
推荐理由:官方给出 Agents SDK 的两项能力变化,读者可据此判断长时运行智能体的构建方式是否改变。
HCompany 发布 HoloTab,一款 Chrome 扩展,可像人一样浏览网页并自动完成跨网站任务,无需任何配置或技术背景。用户只需描述需求,智能体便在浏览器内导航界面、填写字段并做出决策,底层由视觉模型、动作规划和界面理解驱动。
推荐理由:官方给出浏览器智能体的录制复用机制与免费入口,可据此判断零门槛自动化任务的落地方式。
OpenAI 扩展 Trusted Access for Cyber 计划,向经过审核的防御者推出 GPT-5.4-Cyber,并随 AI 网络安全能力提升强化防护措施。
Google 发布研究实验 Vantage,通过生成式 AI 构建模拟环境中的多轮对话,评估高中与大学生面向未来的技能,现已在 Google Labs 开放英文注册。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,强化了空间推理与多视角理解,并新增仪表读数能力。
推荐理由:官方给出与前代及 Gemini 3.0 Flash 的对比,并首次开放仪表读数能力,可据此判断机器人高层推理的进展。
Cloudflare 将 OpenAI 的 GPT-5.4 和 Codex 引入 Agent Cloud,让企业能够构建、部署并规模化运行面向真实任务的 AI 智能体,兼顾速度与安全。
OpenAI 发布指南,介绍如何创建和使用 ChatGPT 技能(skills),以构建可复用工作流、自动化重复性任务并保证稳定高质量的输出。
OpenAI 发布指南,介绍如何用 ChatGPT 探索数据集、生成洞察、创建可视化,并将发现转化为可执行的决策。
OpenAI 介绍客户成功团队如何使用 ChatGPT 管理客户账户、改善沟通、降低流失率,并推动产品采用与续约。
OpenAI 发布面向初学者的 AI 基础指南,解释 AI 是什么、如何运作,以及 ChatGPT 这类工具如何使用大语言模型。内容为入门级科普,未涉及具体模型版本、参数或性能数据。
OpenAI 发布面向运营团队的 ChatGPT 指南,介绍运营团队如何用 ChatGPT 简化工作流、改善协作、标准化流程并加快执行速度。
OpenAI 发布面向财务团队的 ChatGPT 工作流学习内容,覆盖财务分析、报告、规划与决策沟通等实用场景。内容聚焦如何将 ChatGPT 应用于财务日常工作流程。
ChatGPT 的 projects 功能可用于组织对话、文件和指令,管理持续推进的工作并提升协作效率。该指南介绍了如何借助 projects 更有效地开展协作。
OpenAI 发布指南,介绍如何用 ChatGPT 通过清晰的提示词创建和优化图像,并迭代设计方案,在几分钟内生成高质量视觉内容。
OpenAI 发布指南,介绍如何用 ChatGPT 做研究:收集来源、分析信息,并生成结构化、带引用的洞察。
OpenAI 展示了旗下 ChatGPT、Codex 和 API 等产品在真实场景中的应用方式,覆盖工作、开发与日常任务。内容围绕这些产品如何将 AI 带入实际使用展开。
OpenAI 介绍在 ChatGPT 中处理文件的实用方法,涵盖从查找信息到整理、转换文档,以及将文件用于工作流等场景。
OpenAI 发布提示词基础指南,讲解如何写出清晰有效的提示词,从而让 ChatGPT 给出更好、更有用的回答。内容面向希望提升提示词技巧的用户,聚焦提示词撰写的基本原则。
OpenAI 介绍临床医生如何使用 ChatGPT 支持诊断、病历记录和患者护理,并强调相关工具具备安全、符合 HIPAA 的 AI 能力。
OpenAI 介绍如何通过自定义指令和记忆功能个性化 ChatGPT,以获得更相关、一致且贴合个人需求的回答。
OpenAI 介绍营销团队如何用 ChatGPT 完成活动策划、内容创作与效果分析,并将洞察转化为行动。文章围绕实际 AI 工作流展开,覆盖从规划到执行的营销环节。
OpenAI 发布指南,介绍如何用 ChatGPT 的搜索与深度研究(deep research)功能获取最新信息、分析来源并生成结构化洞察。
OpenAI 发布指南,介绍如何用 ChatGPT 进行写作,完成内容的起草、修改与润色,并保持清晰的结构、语气和意图。
OpenAI 介绍如何用 ChatGPT 进行头脑风暴,把粗略想法整理成结构化、可执行的计划。内容涵盖激发创意与梳理思路,属于使用指南而非新功能发布。
OpenAI 发布面向销售团队的 ChatGPT 实用工作流,覆盖客户调研、会议准备、外联沟通、销售管道复盘与销售执行等环节。
OpenAI 发布面向金融服务机构的 AI 资源,包含提示词包、GPTs、指南和工具,帮助机构安全部署并规模化应用 AI。
OpenAI 介绍管理者如何用 ChatGPT 准备沟通、撰写清晰反馈、保持条理并提升团队效率。内容围绕对话准备、反馈写作和团队效能等管理场景展开。
OpenAI 就 Axios 供应链攻击作出回应,已轮换 macOS 代码签名证书并更新应用,同时确认没有用户数据遭到泄露。
OpenAI 发布指南,介绍使用 ChatGPT 等工具时在安全、准确性和透明度方面的最佳实践,以帮助用户负责任地使用 AI。
Google Research 推出 ConvApparel,一个包含超 4,000 段人机多轮对话(近 15,000 轮)的服饰购物领域数据集,用于量化 LLM 用户模拟器与真实人类的真实感差距。
CyberAgent 采用 ChatGPT Enterprise 与 Codex,在广告、媒体和游戏业务中安全扩大 AI 应用规模、提升质量并加快决策。
Overworld 发布实时视频世界模型 Waypoint-1.5,在 RTX 3090 至 5090 等桌面硬件上可生成最高 720p、60 FPS 的实时环境,并新增面向更广消费级硬件的 360p 版本,后续将支持 Apple Silicon Mac。
推荐理由:Waypoint-1.5 把实时世界模型从数据中心拉到消费级显卡,读者可据此判断本地交互式生成世界的硬件门槛。
Sentence Transformers v5.4 更新后,可用同一套 API 编码和比较文本、图像、音频与视频,并支持多模态嵌入与重排模型。嵌入模型把不同模态映射到共享向量空间,重排模型对混合模态输入对打分,可用于视觉文档检索、跨模态搜索和多模态 RAG。
推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此判断跨模态检索如何接入现有 RAG 流程。
Google 发布两个学术智能体框架:PaperVizAgent(原 PaperBanana)从论文方法章节生成出版级图表,ScholarPeer 则自动评审论文。
OpenAI 阐述了企业级 AI 的下一阶段,随着各行业采用加速,其企业产品线涵盖 Frontier、ChatGPT Enterprise、Codex 以及公司范围内的 AI 智能体。
OpenAI 发布 Child Safety Blueprint,一套面向 AI 负责任开发的路线图,涵盖安全防护措施、适龄设计和多方协作,目标是保护并赋能年轻人在线使用 AI。
Safetensors 已加入 PyTorch 基金会,成为 Linux 基金会下与 DeepSpeed、Helion、Ray、vLLM 和 PyTorch 并列的托管项目,商标、仓库和治理权归属 Linux 基金会而非任何单一公司。
OpenAI 宣布推出 Safety Fellowship,这是一个支持独立安全与对齐研究的试点项目,同时致力于培养下一代人才。
Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT),在真实用户-助手场景中评估 LLM 行为倾向与人类共识的对齐程度。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在无共识时无法覆盖人类意见的分布范围。