Google DeepMind 向美国 AI Ultra 订阅者开放 Project Genie 世界模型原型
Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅者开放 Project Genie,这是一个由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性研究原型,支持创建、探索和混编交互式世界。
推荐理由:官方披露了世界模型原型的三项核心能力与已知限制,可据此判断实时生成交互世界的可用边界。
Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅者开放 Project Genie,这是一个由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性研究原型,支持创建、探索和混编交互式世界。
推荐理由:官方披露了世界模型原型的三项核心能力与已知限制,可据此判断实时生成交互世界的可用边界。
OpenAI 构建了一个内部 AI 数据智能体,结合 GPT-5、Codex 和记忆能力对海量数据集进行推理,可在数分钟内给出可靠洞察。该智能体面向内部数据分析场景,核心在于用记忆机制支撑跨数据集的持续推理。
大成建设人力资源团队正在全公司推广 ChatGPT Enterprise,用于推动 AI 驱动的人才培养。
Gradio 团队发布开源 Python 库 Daggr,用于把 Gradio 应用、ML 模型和自定义函数串成 AI 工作流,并自动生成可视化画布。画布可查看任意节点的中间输出、修改输入并单独重跑某一步,无需执行整条流水线,还支持状态持久化和备份节点替换。
推荐理由:Gradio 团队开源 Daggr,用代码定义工作流并自动生成可视化画布,可单独重跑某一步,为多模型串联调试提供了新选择。
OpenAI 宣布将于 2026 年 2 月 13 日在 ChatGPT 中退役 GPT-4o、GPT-4.1、GPT-4.1 mini 和 OpenAI o4-mini,与此前已公布的 GPT-5(Instant、Thinking 和 Pro)退役同步进行。API 侧目前没有变化。
推荐理由:OpenAI 官方给出 ChatGPT 中多款旧模型的退役时间表,并说明 API 侧暂不受影响。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 组智能体配置做大规模对照评测,覆盖单智能体与独立、集中、去中心化、混合四种多智能体架构,以及 Finance-Agent、BrowseComp-Plus、PlanCraft、Workbench 四个基准。
推荐理由:通过 180 组智能体配置的对照评测,给出多智能体架构何时增益、何时拖累性能的量化规律。
OpenAI 开放 EMEA Youth & Wellbeing Grant 申请,该项目总额 50 万欧元,用于资助在 AI 时代推进青少年安全与福祉的非政府组织和研究人员。
OpenAI 发布欧盟经济蓝图 2.0,以新数据、合作伙伴关系和多项举措推动欧洲的 AI 应用、技能培养与经济增长。
OpenAI 说明了 AI 智能体打开链接时如何保护用户数据,通过内置防护机制防止基于 URL 的数据外泄和提示词注入。
Hugging Face 发布新工具 upskill,用大模型生成并评测 agent skill,再交给小模型使用。
推荐理由:原文给出用大模型生成 Skill 再迁移到小模型的完整流程与评测命令,可迁移到其他专业任务。
Google Research 发布 ATLAS(自适应迁移缩放律),用于指导多语言模型的模型规模、数据量与语言配比选择,论文将在 ICLR 2026 展示。该研究基于 774 次训练运行、10M–8B 参数模型、400+ 语言数据和 48 种语言评测,并给出 1,400 对语言之间的迁移关系矩阵。
Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式,CLI 修复持续自动更新。
推荐理由:官方给出 Vibe 2.0 的自定义子智能体、斜杠命令技能与定价变化,可据此判断终端编码智能体的使用成本。
中国开源模型近一年几乎一致转向 MoE 架构,Kimi K2、MiniMax M2、Qwen3 均采用该路线,以在算力约束下平衡能力与成本。开源方向从文本扩展到多模态与智能体,StepFun 的 Step-Audio-R1.1 语音模型性能超越闭源模型,腾讯开源 Hunyuan Video 与 Hunyuan 3D。
Hugging Face 团队推出 Alyah(阿联酋方言中意为"北极星"),一个专门评估阿拉伯语 LLM 阿联酋方言能力的基准,包含 1,173 条由阿联酋母语者手工采集的样本,每题四选一。评测覆盖 54 个模型(23 个基座、31 个指令微调),google/gemma-3-27b-pt 以 74.68 的准确率居首,tiiuae/Falcon-H1-34B-Base 为 73.66。
Calvin Klein 与 Tommy Hilfiger 母公司 PVH 正在采用 ChatGPT Enterprise,将 AI 引入时装设计、供应链和消费者互动环节。
Hugging Face 团队用 verl 框架对 GPT-OSS-20B 做智能体强化学习训练,发现 KL 散度和熵爆炸、奖励不升,根因是 MoE 架构下双前向传播导致新旧 log-prob 不匹配、破坏 PPO 的 on-policy 一致性。团队通过修复 attention sink 和 MoE log-prob 对齐解决该问题,该修复同样适用于 GPT-OSS-120B。
TRUSTBANK 与 Recursive 合作,基于 OpenAI 模型打造了 Choice AI,通过个性化对话式推荐简化故乡税(Furusato Nozei)礼品的发现与选择。
OpenAI 推出 Prism,一个内置 GPT-5.2 的免费 LaTeX 原生工作空间,让研究人员在同一处完成写作、协作与推理。
Indeed CRO Maggie Hulce 分享了 AI 如何改变求职、招聘与企业人才获取方式,同时服务于雇主和求职者两端。
Google Research 在 NeurIPS 2025 提出 GIST(Greedy Independent Set Thresholding)算法,用于训练数据子集选择,在多样性与效用之间取得平衡。GIST 在图像分类等基准任务上超越现有最优方法,并首次为该权衡提供可证明的近似保证:所选子集价值至少达到最优解的一半。
OpenAI 发布 Codex 智能体循环技术解析,说明 Codex CLI 如何借助 Responses API 编排模型、工具、提示词与性能。文章为技术深度剖析,未披露新版本号、参数规模或 benchmark 数据。
Google Research 提出一种拆解式方法,让小型多模态 LLM 在设备端理解用户意图:先逐屏总结每次交互,再从摘要序列中提取意图。在移动端与网页轨迹上,该方法优于 CoT 和端到端微调,Gemini 1.5 Flash 8B 取得与 Gemini 1.5 Pro 相当的结果,成本与速度仅为后者一小部分。该论文已在 EMNLP 2025 发表。
OpenAI 发文介绍其如何将 PostgreSQL 扩展到每秒数百万次查询,以支撑 8 亿 ChatGPT 用户。文中提到的主要手段包括副本、缓存、限流和工作负载隔离。
Praktika 利用 GPT-4.1 和 GPT-5.2 构建自适应 AI 导师,为学习者提供个性化课程、进度追踪,并帮助实现真实场景的语言流利度。该方案以对话式教学为核心,将大模型能力融入语言学习流程。
OpenAI 发布了一份数据驱动报告,揭示各行业员工如何使用 ChatGPT 中的 GPT-5,涵盖采用趋势、高频任务、部门使用模式以及 AI 在职场中的未来走向。
Mistral AI 团队在预生产测试中发现,Mistral Medium 3.1 在 vLLM 上启用图编译并采用 NIXL 的 Prefill/Decode 分离式部署时,系统内存以每分钟 400 MB 线性增长,数小时后触发 out of memory。
Higgsfield 借助 OpenAI 的 GPT-4.1、GPT-5 和 Sora 2,让创作者用简单输入即可生成电影级、适配社交平台的视频。
Hugging Face 发布 AssetOpsBench,一个面向工业资产运维的智能体评测基准,包含 2.3M 传感器遥测点、140+ 场景、4.2K 工单和 53 种结构化故障模式,覆盖 4 个智能体。
OpenAI 推出 Edu for Countries 新计划,帮助各国政府利用 AI 推动教育系统现代化并培养面向未来的劳动力。该计划面向政府层面,聚焦教育体系升级与人才储备建设。
OpenAI 最新报告显示各国在先进 AI 采用上存在显著差距,并提出新举措帮助各国从 AI 中获取生产力收益。报告聚焦"能力过剩"问题,即模型能力已具备但尚未被广泛使用。
OpenAI 与盖茨基金会联合启动 Horizon 1000,这是一项投入 5000 万美元的试点项目,用于推进非洲基层医疗领域的 AI 能力。该计划目标是在 2028 年前覆盖 1000 家诊所。
推荐理由:OpenAI 与盖茨基金会出资 5000 万美元在非洲试点医疗 AI,可了解其落地规模与时间表。
OpenAI 公布 Stargate Community 计划,提出以社区优先的方式建设 AI 基础设施。该计划采用因地制宜的方案,由社区意见、能源需求与劳动力优先事项共同塑造。
DeepSeek 于去年 1 月发布 R-1 模型,成为 Hugging Face 史上获赞最多的模型,并推动中国开源 AI 生态在过去一年快速扩张。R-1 以 MIT 许可证开放推理路径与后训练方法,降低了技术、采用和心理三重门槛。
ServiceNow 扩大对 OpenAI 前沿模型的接入,用于驱动 ServiceNow 平台上的 AI 企业工作流、摘要、搜索与语音功能。
微软发布 Differential Transformer V2(DIFF V2),在保持 KV 头数量不变的前提下将查询头数量翻倍,使解码速度与标准 Transformer 持平,且无需自定义注意力内核。
Overworld 发布实时交互视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘控制,权重已上线 Hugging Face Hub,Waypoint-1-Small 为 2.3B,Medium 版本即将推出。
推荐理由:原文给出模型规模、训练数据量与推理库性能数字,可据此判断实时交互视频生成在消费级硬件上的可行性。
ChatGPT 正在推出年龄预测功能,用于判断账号用户是否年满 18 岁,并对青少年账号应用相应保护措施。OpenAI 表示该功能的准确性将随时间推移持续优化。
OpenAI 的商业模式随智能水平提升而扩展,覆盖订阅、API、广告、商业和算力,由 ChatGPT 采用率持续加深所驱动。
Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),用统一的编码器-解码器 Transformer 架构完成动态场景的 4D 重建与追踪。
推荐理由:D4RT 把动态场景重建统一进单一框架,读者可了解 4D 重建的效率提升幅度与机器人、AR 等落地方向。
OpenAI 宣布 ChatGPT Go 已在全球上线,提供 GPT-5.2 Instant 的扩展访问、更高的使用额度和更长的记忆能力。官方称该档位让先进 AI 在全球范围内更可负担。
推荐理由:官方给出 ChatGPT Go 的全球开放范围与三项能力变化,可据此判断低价档位的实际可用边界。