TRUSTBANK 用 AI 智能体个性化推荐故乡税礼品
TRUSTBANK 与 Recursive 合作,基于 OpenAI 模型打造了 Choice AI,通过个性化对话式推荐简化故乡税(Furusato Nozei)礼品的发现与选择。
TRUSTBANK 与 Recursive 合作,基于 OpenAI 模型打造了 Choice AI,通过个性化对话式推荐简化故乡税(Furusato Nozei)礼品的发现与选择。
OpenAI 发布 Codex 智能体循环技术解析,说明 Codex CLI 如何借助 Responses API 编排模型、工具、提示词与性能。文章为技术深度剖析,未披露新版本号、参数规模或 benchmark 数据。
Hugging Face 发布 AssetOpsBench,一个面向工业资产运维的智能体评测基准,包含 2.3M 传感器遥测点、140+ 场景、4.2K 工单和 53 种结构化故障模式,覆盖 4 个智能体。
OpenAI 发起、开源 AI 社区共建、Hugging Face 生态支持的开放推理标准 Open Responses 发布,它基于 Responses API,面向智能体工作流设计。
推荐理由:OpenAI 发起、开源社区共建的推理标准,读者可据此了解 Responses API 开放后的接口变化与迁移路径。
Netomi 借助 GPT-4.1 和 GPT-5.2 扩展企业级 AI 智能体,通过并发、治理与多步推理支撑可靠的生产工作流。该方案面向企业规模化部署场景,强调智能体系统在生产环境中的稳定性。
NVIDIA 在 CES 2026 发布博客,给出用 DGX Spark 加 Reachy Mini 复现黄仁勋主题演讲中桌面智能体的分步教程,源码已开源。
推荐理由:完整复现路径覆盖模型选型、路由与工具调用,可据此搭一套本地私有桌面智能体。
ServiceNow 发布 AprielGuard,一个 8B 参数的安全与安全防护模型,可检测 16 类安全风险以及提示词注入、越狱、思维链污染、上下文劫持、记忆投毒和多智能体攻击序列等对抗攻击。
Google DeepMind 发布 Gemini 3 Flash,将 Gemini 3 的推理能力与 Flash 级延迟和成本结合,定价为每 100 万输入 token 0.50 美元、每 100 万输出 token 3 美元。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断它在速度与成本上的取舍。
OpenAI 宣布开发者可以向 ChatGPT 提交应用,经审核通过后会在产品内的新应用目录中展示。官方同时更新了工具、指南和 Apps SDK,用于构建把真实操作带入 ChatGPT 的对话原生体验。
推荐理由:OpenAI 开放 ChatGPT 应用提交入口并给出 Apps SDK 与审核规范,开发者可据此判断接入路径。
IBM 开源的可配置通用智能体 CUGA 上线 Hugging Face Spaces,提供 CRM 演示和 20 个预置工具,用于销售数据查询与 API 交互。
推荐理由:CUGA 在 AppWorld 与 WebArena 上的成绩和 20 个预置工具的演示,能帮读者判断可配置智能体的落地方式。
Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,改进函数调用、指令遵循与多轮对话能力。
推荐理由:官方给出函数调用、指令遵循与多轮对话三项改进的具体分数,可据此判断语音智能体的可用性提升。
BNY 利用 OpenAI 在全企业范围扩大 AI 应用,通过 Eliza 平台让 20,000 多名员工构建 AI 智能体,以提升效率和客户成果。
Podium 基于 OpenAI 的 GPT-5 构建了 AI 队友 "Jerry",为 10,000+ 中小企业提供服务,并带来 300% 的增长。该智能体正在改变 Main Street 商家服务客户的方式。
OpenAI 发布 GPT-5.2,定位为面向日常专业工作的前沿模型,具备领先的推理、长上下文理解、编码和视觉能力。该模型已在 ChatGPT 和 OpenAI API 中提供,用于支持更快、更可靠的智能体工作流。
推荐理由:官方给出 GPT-5.2 在推理、长上下文、编码与视觉上的定位,可据此判断日常专业工作与智能体流程的可用性。
Hugging Face 发布教程,展示如何用 Hugging Face Skills 让 OpenAI Codex 端到端完成机器学习实验:微调 Qwen3-0.6B、用 HumanEval 评测、生成训练报告并导出 GGUF。
推荐理由:以完整实验流程展示编码智能体如何端到端完成微调、评测与部署,可迁移到自己的训练任务。
Mistral AI 发布新一代编码模型系列 Devstral 2,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。
推荐理由:官方给出两款开源编码模型的参数、许可与 SWE-bench 成绩,并附与闭源模型的对比评测,可据此判断开源编码智能体的当前水位。
OpenAI 在 Linux 基金会下联合创立 Agentic AI Foundation,并将 AGENTS.md 捐赠给该基金会。此举意在支持面向安全智能体 AI 的开放、可互操作标准。
Intel AI Software Group 推出 DeepMath,一个基于 Qwen3-4B Thinking、用 GRPO 微调并在 smolagents 上实现的数学推理 Agent,通过生成 Python 片段在沙箱中执行来替代冗长文本推理。
Hugging Face 发布 Hugging Face Skills,让 Claude Code、Codex、Gemini CLI 等编码智能体直接提交云端 GPU 训练任务、监控进度并把模型推到 Hub。
推荐理由:官方给出从数据校验到 GGUF 转换的完整训练链路,可据此判断对话式微调的实际边界与成本。
Mirakl 正借助 AI 智能体与 ChatGPT Enterprise 重塑电商,实现更快的文档撰写和更智能的客户支持,并推进 Mirakl Nexus 构建智能体原生电商。
Accenture 与 OpenAI 正展开合作,帮助企业将智能体 AI 能力引入业务核心,以释放新的增长空间。
Hugging Face 分享构建 SOTA 深度研究智能体的经验:七个月前其首版架构因假设过于复杂,在新一代模型到来后成为瓶颈,被迫推倒重建。团队转向更简化的编排逻辑并依赖模型自主性,同时借助 Tavily Advanced Search 在工具侧完成上下文工程,只返回最相关内容块以降低幻觉与延迟。
Google DeepMind 宣布支持美国白宫 Genesis 计划,与美国能源部合作,为全部 17 个国家实验室提供前沿 AI for Science 模型和智能体工具的加速访问通道,即日起从 Google Cloud 上的 AI co-scientist 开始。
推荐理由:Google DeepMind 与 DOE 合作开放前沿科研模型给 17 个国家实验室,可了解 AI for Science 的落地路径。
OpenAI 在 ChatGPT 中推出购物研究功能,帮助用户浏览、比较和发现商品,并生成个性化买家指南以简化决策。该功能由 OpenAI 官方发布,目前材料仅给出功能定位,未披露具体入口和上线范围。
推荐理由:OpenAI 官方给出 ChatGPT 购物研究功能的定位,读者可据此了解它在选购决策环节承担的角色。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,面向开发者提供影棚级图像生成与编辑,已在 Google AI Studio 和 Vertex AI 以付费预览形式逐步开放。
推荐理由:官方给出新图像模型的分辨率、文本渲染与搜索接地能力,以及 Adobe、Figma 等接入情况,便于判断其与上一代的取舍。
OpenAI 发布 GPT-5.1-Codex-Max 系统卡,说明该模型在模型层与产品层部署的安全措施。模型层包括针对有害任务和提示词注入的专项安全训练,产品层则涵盖智能体沙箱与可配置网络访问。
Google DeepMind 发布 Gemini 3 Pro,称其在主要 AI 基准上超过此前版本,编码与智能体任务表现优于 2.5 Pro。模型已在 Google AI Studio 和 Vertex AI 以预览形式开放,200k token 以内输入 $2/百万 token、输出 $12/百万 token,并在 Google AI Studio 免费提供但有限速。
推荐理由:官方给出 Gemini 3 Pro 的基准成绩、API 定价与 Antigravity 平台入口,可据此判断其编码与智能体能力落点。
Google DeepMind 发布 Gemini 3,称其为自家最智能的模型,首发 Gemini 3 Pro 预览版,并同步上线 Gemini 应用、Search 的 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新的智能体开发平台 Google Antigravity。
推荐理由:官方一次性给出 Gemini 3 Pro 与 Deep Think 的基准成绩、产品落地范围和开放入口,可据此判断能力代际变化。
Google 发布智能体开发平台 Antigravity,已开放免费公开预览,支持 macOS、Linux 和 Windows。该平台在传统 AI IDE 的 Editor 视图之外新增面向智能体的 Manager 视图,可并行编排多个工作区中的智能体,并通过任务列表、实现计划、截图和浏览器录制等 Artifacts 呈现工作过程。
推荐理由:Google 把 IDE 拆成同步编辑器与异步 Agent Manager 两层,读者可据此判断智能体编程工具的产品形态走向。
Google 推出生成式 UI 实现,由模型按提示词自动生成网页、游戏、工具等交互界面,而非渲染静态预设界面。该能力以 dynamic view 和 visual layout 两个实验在 Gemini app 上线,并集成到 Google Search 的 AI Mode,基于 Gemini 3 Pro 与工具调用、系统指令、后处理三部分实现。
推荐理由:Google 把生成式 UI 落到 Gemini 与搜索 AI Mode,读者可了解其实现路径与人工评测偏好结果。
Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从指令跟随者升级为能思考目标、与用户对话并随时间自我改进的交互式游戏伙伴。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,读者可了解从指令跟随到自主推理与自我改进的路径。
Google 推出数据科学智能体 DS-STAR,通过数据文件分析、LLM 评判验证与顺序规划迭代三项机制,在 DABStep、KramaBench、DA-Code 三个基准上全面超越 AutoGen 和 DA-Agent,准确率分别从 41.0% 提升至 45.2%、39.8% 提升至 44.7%、37.0% 提升至 38.5%,并登顶 DABStep 公开榜单。
Chime CMO Vineet Mehra 分享了 AI 如何将营销重塑为智能体驱动的模式。他认为,优先提升 AI 素养并审慎采用 AI 的领导者将推动增长。
OpenAI 推出 AI 安全研究员 Aardvark,可自主发现、验证并协助修复大规模软件漏洞。该系统目前处于 private beta 阶段,可报名参与早期测试。
MiniMax M2 在 post-training 的智能体对齐阶段提出,智能体泛化不只是适配新工具,而是要在工具信息、系统提示词、用户提示词、环境和工具返回等全流程扰动下保持稳定。团队因此采用 Interleaved Thinking,让思考过程贯穿任务全程而非仅在开头,并构建了面向全轨迹泛化的数据管线。M2 用户需保留包含思考步骤的完整会话历史,否则会出现性能差距。
OpenAI 详解支撑 ChatGPT Atlas 的新架构 OWL,其核心是将 Chromium 解耦,从而实现快速启动、丰富 UI 以及由 ChatGPT 驱动的智能体浏览。
Google Research 发布 StreetReaderAI 无障碍街景原型,基于 Gemini 构建 AI Describer 与 AI Chat 两个子系统,为盲人和低视力用户实时生成道路、路口与地点的语音描述,并支持语音或键盘平移、移动和跳转。
Google 公布个人健康教练的构建细节,该功能由 Gemini 模型驱动,面向美国 Fitbit Premium 的 Android 用户开放可选公开预览,并将扩展到 iOS。
推荐理由:Google 公开了健康教练的多智能体架构与 SHARP 评估框架,可了解 Gemini 在健康场景的落地方式。
Mistral AI 发布企业级生产平台 Mistral AI Studio,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成,覆盖评估、反馈闭环、版本溯源与治理。
推荐理由:Mistral 把自家大规模系统的可观测、执行与治理能力打包成企业平台,可了解生产级 AI 的落地路径。
Consensus 基于 GPT-5 和 OpenAI 的 Responses API 打造多智能体研究助手,可在数分钟内读取、分析并综合证据,已服务超 800 万名研究人员。