Hugging Face 发布 upskill:用 Claude 生成 CUDA kernel 技能并教给开源模型
Hugging Face 发布新工具 upskill,用大模型生成并评测 agent skill,再交给小模型使用。
推荐理由:原文给出用大模型生成 Skill 再迁移到小模型的完整流程与评测命令,可迁移到其他专业任务。
Hugging Face 发布新工具 upskill,用大模型生成并评测 agent skill,再交给小模型使用。
推荐理由:原文给出用大模型生成 Skill 再迁移到小模型的完整流程与评测命令,可迁移到其他专业任务。
Google Research 发布 ATLAS(自适应迁移缩放律),用于指导多语言模型的模型规模、数据量与语言配比选择,论文将在 ICLR 2026 展示。该研究基于 774 次训练运行、10M–8B 参数模型、400+ 语言数据和 48 种语言评测,并给出 1,400 对语言之间的迁移关系矩阵。
Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式,CLI 修复持续自动更新。
推荐理由:官方给出 Vibe 2.0 的自定义子智能体、斜杠命令技能与定价变化,可据此判断终端编码智能体的使用成本。
中国开源模型近一年几乎一致转向 MoE 架构,Kimi K2、MiniMax M2、Qwen3 均采用该路线,以在算力约束下平衡能力与成本。开源方向从文本扩展到多模态与智能体,StepFun 的 Step-Audio-R1.1 语音模型性能超越闭源模型,腾讯开源 Hunyuan Video 与 Hunyuan 3D。
Hugging Face 团队推出 Alyah(阿联酋方言中意为"北极星"),一个专门评估阿拉伯语 LLM 阿联酋方言能力的基准,包含 1,173 条由阿联酋母语者手工采集的样本,每题四选一。评测覆盖 54 个模型(23 个基座、31 个指令微调),google/gemma-3-27b-pt 以 74.68 的准确率居首,tiiuae/Falcon-H1-34B-Base 为 73.66。
Calvin Klein 与 Tommy Hilfiger 母公司 PVH 正在采用 ChatGPT Enterprise,将 AI 引入时装设计、供应链和消费者互动环节。
Hugging Face 团队用 verl 框架对 GPT-OSS-20B 做智能体强化学习训练,发现 KL 散度和熵爆炸、奖励不升,根因是 MoE 架构下双前向传播导致新旧 log-prob 不匹配、破坏 PPO 的 on-policy 一致性。团队通过修复 attention sink 和 MoE log-prob 对齐解决该问题,该修复同样适用于 GPT-OSS-120B。
TRUSTBANK 与 Recursive 合作,基于 OpenAI 模型打造了 Choice AI,通过个性化对话式推荐简化故乡税(Furusato Nozei)礼品的发现与选择。
OpenAI 推出 Prism,一个内置 GPT-5.2 的免费 LaTeX 原生工作空间,让研究人员在同一处完成写作、协作与推理。
Indeed CRO Maggie Hulce 分享了 AI 如何改变求职、招聘与企业人才获取方式,同时服务于雇主和求职者两端。
Google Research 在 NeurIPS 2025 提出 GIST(Greedy Independent Set Thresholding)算法,用于训练数据子集选择,在多样性与效用之间取得平衡。GIST 在图像分类等基准任务上超越现有最优方法,并首次为该权衡提供可证明的近似保证:所选子集价值至少达到最优解的一半。
OpenAI 发布 Codex 智能体循环技术解析,说明 Codex CLI 如何借助 Responses API 编排模型、工具、提示词与性能。文章为技术深度剖析,未披露新版本号、参数规模或 benchmark 数据。
Google Research 提出一种拆解式方法,让小型多模态 LLM 在设备端理解用户意图:先逐屏总结每次交互,再从摘要序列中提取意图。在移动端与网页轨迹上,该方法优于 CoT 和端到端微调,Gemini 1.5 Flash 8B 取得与 Gemini 1.5 Pro 相当的结果,成本与速度仅为后者一小部分。该论文已在 EMNLP 2025 发表。
OpenAI 发文介绍其如何将 PostgreSQL 扩展到每秒数百万次查询,以支撑 8 亿 ChatGPT 用户。文中提到的主要手段包括副本、缓存、限流和工作负载隔离。
Praktika 利用 GPT-4.1 和 GPT-5.2 构建自适应 AI 导师,为学习者提供个性化课程、进度追踪,并帮助实现真实场景的语言流利度。该方案以对话式教学为核心,将大模型能力融入语言学习流程。
OpenAI 发布了一份数据驱动报告,揭示各行业员工如何使用 ChatGPT 中的 GPT-5,涵盖采用趋势、高频任务、部门使用模式以及 AI 在职场中的未来走向。
Mistral AI 团队在预生产测试中发现,Mistral Medium 3.1 在 vLLM 上启用图编译并采用 NIXL 的 Prefill/Decode 分离式部署时,系统内存以每分钟 400 MB 线性增长,数小时后触发 out of memory。
Higgsfield 借助 OpenAI 的 GPT-4.1、GPT-5 和 Sora 2,让创作者用简单输入即可生成电影级、适配社交平台的视频。
Hugging Face 发布 AssetOpsBench,一个面向工业资产运维的智能体评测基准,包含 2.3M 传感器遥测点、140+ 场景、4.2K 工单和 53 种结构化故障模式,覆盖 4 个智能体。
OpenAI 推出 Edu for Countries 新计划,帮助各国政府利用 AI 推动教育系统现代化并培养面向未来的劳动力。该计划面向政府层面,聚焦教育体系升级与人才储备建设。
OpenAI 最新报告显示各国在先进 AI 采用上存在显著差距,并提出新举措帮助各国从 AI 中获取生产力收益。报告聚焦"能力过剩"问题,即模型能力已具备但尚未被广泛使用。
OpenAI 与盖茨基金会联合启动 Horizon 1000,这是一项投入 5000 万美元的试点项目,用于推进非洲基层医疗领域的 AI 能力。该计划目标是在 2028 年前覆盖 1000 家诊所。
推荐理由:OpenAI 与盖茨基金会出资 5000 万美元在非洲试点医疗 AI,可了解其落地规模与时间表。
OpenAI 公布 Stargate Community 计划,提出以社区优先的方式建设 AI 基础设施。该计划采用因地制宜的方案,由社区意见、能源需求与劳动力优先事项共同塑造。
DeepSeek 于去年 1 月发布 R-1 模型,成为 Hugging Face 史上获赞最多的模型,并推动中国开源 AI 生态在过去一年快速扩张。R-1 以 MIT 许可证开放推理路径与后训练方法,降低了技术、采用和心理三重门槛。
ServiceNow 扩大对 OpenAI 前沿模型的接入,用于驱动 ServiceNow 平台上的 AI 企业工作流、摘要、搜索与语音功能。
微软发布 Differential Transformer V2(DIFF V2),在保持 KV 头数量不变的前提下将查询头数量翻倍,使解码速度与标准 Transformer 持平,且无需自定义注意力内核。
Overworld 发布实时交互视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘控制,权重已上线 Hugging Face Hub,Waypoint-1-Small 为 2.3B,Medium 版本即将推出。
推荐理由:原文给出模型规模、训练数据量与推理库性能数字,可据此判断实时交互视频生成在消费级硬件上的可行性。
ChatGPT 正在推出年龄预测功能,用于判断账号用户是否年满 18 岁,并对青少年账号应用相应保护措施。OpenAI 表示该功能的准确性将随时间推移持续优化。
OpenAI 的商业模式随智能水平提升而扩展,覆盖订阅、API、广告、商业和算力,由 ChatGPT 采用率持续加深所驱动。
Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),用统一的编码器-解码器 Transformer 架构完成动态场景的 4D 重建与追踪。
推荐理由:D4RT 把动态场景重建统一进单一框架,读者可了解 4D 重建的效率提升幅度与机器人、AR 等落地方向。
OpenAI 宣布 ChatGPT Go 已在全球上线,提供 GPT-5.2 Instant 的扩展访问、更高的使用额度和更长的记忆能力。官方称该档位让先进 AI 在全球范围内更可负担。
推荐理由:官方给出 ChatGPT Go 的全球开放范围与三项能力变化,可据此判断低价档位的实际可用边界。
OpenAI 计划在美国为 ChatGPT 的免费档和 Go 档测试广告,以扩大全球范围内可负担的 AI 使用渠道。官方表示测试过程中会保护隐私、信任与回答质量。
推荐理由:OpenAI 官方说明 ChatGPT 免费与 Go 档将试水广告,可据此观察其商业化与可及性之间的取舍。
Google 研究团队提出一种基于时序卷积网络(TCN)的多头深度学习模型,仅凭单只 Pixel Watch 的 IMU 信号和用户身高,即可直接估算步速、步长、双支撑时间等多项步态指标。在 246 名参与者、约 7 万段步行数据的验证中,手表估算与手机结果无显著差异(p>0.05),多数指标 Pearson r>0.80、ICC>0.80。
OpenAI 投资 Merge Labs,以支持连接生物智能与人工智能的新型脑机接口,目标是最大化人类的能力、能动性与体验。
OpenAI 发起一项新的 RFP,旨在通过加速美国本土制造、创造就业岗位并扩展 AI 基础设施,来强化美国 AI 供应链。
OpenAI 发起、开源 AI 社区共建、Hugging Face 生态支持的开放推理标准 Open Responses 发布,它基于 Responses API,面向智能体工作流设计。
推荐理由:OpenAI 发起、开源社区共建的推理标准,读者可据此了解 Responses API 开放后的接口变化与迁移路径。
OpenAI 宣布与 Cerebras 合作,新增 750MW 高速 AI 算力,用于降低推理延迟并让 ChatGPT 在实时 AI 负载下响应更快。
Google Research 利用 Virginia 和 California 的公开碰撞数据与 Android Auto 匿名聚合的急刹车事件(HBE,减速度超过 -3m/s²)数据,通过负二项回归模型确认 HBE 频率与路段碰撞率呈显著正相关。
Google 发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并同步推出医疗听写语音识别模型 MedASR。
推荐理由:官方给出 MedGemma 1.5 与 MedASR 的基准对比和开放下载入口,可据此判断医疗多模态模型的可用边界。
Google DeepMind 更新 Veo 3.1 的 Ingredients to Video 能力,让基于参考图生成的视频在简单提示词下也有更丰富的对白与叙事,并提升角色、背景和物体的一致性。
推荐理由:官方说明了 Ingredients to Video 在角色一致性与竖屏输出上的具体变化,可据此判断移动端短视频工作流是否值得切换。