Bertelsmann 与 OpenAI 合作,将 AI 技术整合至全球多品牌业务
总部位于德国的全球媒体、服务与教育公司 Bertelsmann 将把 OpenAI 的技术整合到其全球多个品牌中。
总部位于德国的全球媒体、服务与教育公司 Bertelsmann 将把 OpenAI 的技术整合到其全球多个品牌中。
OpenAI 提出通过增加推理时计算来提升模型的对抗鲁棒性,即让模型在回答前进行更多思考。研究发现,随着推理时计算增加,模型对对抗性攻击的鲁棒性随之提升,但这一过程存在权衡。
Hugging Face 与 FriendliAI 达成合作,将 FriendliAI Endpoints 集成进 Hugging Face Hub 的“Deploy this model”按钮,实现开源或自定义生成式 AI 模型的一键部署。
OpenAI 发布 Stargate Infrastructure 表单,面向数据中心基础设施领域征集合作企业,覆盖电力、土地、建设到设备等环节。OpenAI 表示将与战略伙伴共同推进 AGI 基础设施建设,并希望与工业基础各环节公司建立合作。
推荐理由:OpenAI 公开征集数据中心基础设施合作方,可了解其 AGI 基建布局覆盖的环节。
OpenAI 官方发布公告,宣布 Stargate 项目。公告未提供更多细节,仅给出项目名称与发布动作。
推荐理由:OpenAI 官方宣布 Stargate 项目,读者可据此了解其自建 AI 基础设施的布局方向。
Mistral AI 宣布与法新社(AFP)达成全球合作,其 AI 助手 Le Chat 将接入 AFP 新闻专线内容,为用户提供基于可靠信源的回答。Le Chat 将利用 AFP 每日六种语言(法语、英语、西班牙语、葡萄牙语、德语、阿拉伯语)发布的 2300 条新闻专线,覆盖其全球 1700 名记者的报道。该集成将在未来几周内向所有 Le Chat 用户推出。
Hugging Face 发布 TimmWrapper,让任意 timm 视觉模型可直接接入 transformers 生态,支持 pipeline API、Auto 类和 Trainer 微调。
Hugging Face 为 Text Generation Inference(TGI)引入多后端架构,通过统一的 Rust 前端层接入 vLLM、llama.cpp、TensorRT-LLM 等推理引擎,用户可按模型、硬件和性能需求切换后端。
OpenAI 宣布与 Axios 建立合作,进一步扩大其在新闻行业的合作版图。目前已有代表数百家新闻编辑室和内容品牌的出版商通过 OpenAI 的合作与资助计划采用 AI 工具,ChatGPT 用户也可获取来自领先可靠出版物的信息。
Hugging Face 发布方法,用 Sentence Transformers 训练静态嵌入模型,在 CPU 上比主流嵌入模型快 100 到 400 倍,同时保留大部分质量。
推荐理由:原文公开了静态嵌入模型的完整训练配方与两个已发布模型,读者可据此在 CPU 端复现高效嵌入方案。
Adebayo Ogunlesi 加入 OpenAI 董事会。Ogunlesi 是 Global Infrastructure Partners 的董事长兼首席执行官。
Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的分词器,生成与补全代码速度约为原版 Codestral 的 2 倍,支持 256k 上下文。
推荐理由:Codestral 25.01 的架构与分词器升级带来约 2 倍生成速度,并给出与同量级编码模型的基准对比。
Hugging Face 发布文章《AI Agents Are Here. What Now?》,指出 AI 智能体的风险随自主性等级上升而增加,建议不要开发能自行编写并执行代码的完全自主智能体。文章按自主程度将智能体分为五级,从模型不影响程序流程到模型自行编写并执行新代码,并认为半自主智能体在自主性水平、可用任务和人类控制方式合适时,收益可能大于风险。
Hugging Face 推出多语言视觉文档检索嵌入模型 vdr-2b-multi-v1,可直接编码文档页面截图为稠密单向量,无需 OCR、数据抽取或分块。
Hugging Face 在 Open LLM Leaderboard 中新增模型推理的 CO₂ 排放估算,基于 2024 年 6 月以来对 3000 多个模型的评测数据。分析覆盖 Gemma、Llama、Mistral、Mixtral、Phi、Qwen2 等 2742 个模型,发现社区微调或合并模型通常比其官方基座模型更低碳,而部分 MoE 模型因推理时间过长导致排放高于预期。
Hugging Face 发布 smolagents,一个让语言模型具备智能体能力的轻量库,核心是 CodeAgent,即用代码而非 JSON 编写动作的智能体,同时保留写 JSON 的 ToolCallingAgent。
推荐理由:官方给出 CodeAgent 的定位与代码示例,读者可据此判断代码式动作与 JSON 工具调用的差异。
OpenAI 发文解释其结构必须演进,以推进自身使命,方向是让非营利组织更强大,并由营利性业务取得的成功来支撑。
Hugging Face 博客给出用 torch.cuda.memory._record_memory_history 记录并可视化 PyTorch 训练 GPU 显存占用的完整教程,可在 pytorch.org/memory_viz 拖入 profile.pkl 查看内存曲线。
推荐理由:用 PyTorch 内存快照逐段拆解训练显存构成,并给出可套用的估算公式与工具。
NVIDIA 的 LogitsProcessorZoo 是一套模块化 logits 处理器,可控制序列长度、强制关键短语或引导多选题答案,并与 Hugging Face 的 generate 方法完全兼容。
OpenAI 为 o1 模型提出新的对齐策略 deliberative alignment,直接向模型教授安全规范并教其如何对这些规范进行推理。该策略面向 o1 系列模型,目标是提升语言模型的安全性。
推荐理由:OpenAI 公开 o1 模型的对齐策略,读者可了解其如何把安全规范直接教给模型并让其推理。
Artificial Analysis 发布 Big Bench Audio 评测数据集,用于评估音频语言模型的推理能力,该数据集将 Big Bench Hard 的 1000 道题改编为音频形式。
Answer.AI 与 LightOn 联合发布 ModernBERT,这是一系列编码器模型,作为 BERT 类模型的直接替换方案,提供 base(149M 参数)和 large(395M 参数)两个版本。
推荐理由:ModernBERT 把近年 LLM 的架构与训练经验移植回编码器,读者可据此判断 BERT 类模型在检索与分类场景的替换空间。
IBM 联合普林斯顿、CMU 和 UIUC 发布 Bamba-9B,一个基于完全开放数据训练的混合 Mamba2 模型,训练数据量 2.2T tokens。在 vLLM 中,该模型相比标准 Transformer 实现 2.5 倍吞吐提升和 2 倍延迟加速,并已支持 transformers、vLLM、TRL 和 llama.cpp。
Hugging Face 用 optimum-benchmark 在 Google Cloud 的 C4(第 5 代 Xeon,Emerald Rapids,支持 AMX)与 N2(第 3 代 Xeon,Ice Lake)实例上对比了文本嵌入与文本生成两项智能体负载。
阿布扎比技术创新研究院(TII)发布 Falcon3 开源模型家族,包含 Falcon3-1B-Base、3B-Base、Mamba-7B-Base、7B-Base 和 10B-Base 五款基础模型,全部在 100 亿参数以下。
推荐理由:Falcon3 家族覆盖 1B 到 10B 五款模型,给出了训练数据规模与基准对比,可据此判断小尺寸开源模型的选型空间。
OpenAI 发布 o1 模型,并同步带来 Realtime API 改进和一种新的微调方法等面向开发者的更新。官方公告仅给出上述要点,未披露具体参数、价格或可用范围。
推荐理由:OpenAI 官方一次性给出 o1 模型与 Realtime API、微调方法的更新,便于开发者对照现有集成评估升级点。
Hugging Face 发布 Synthetic Data Generator,一个无代码应用,用户用自然语言描述需求即可生成自定义数据集。工具目前支持文本分类和聊天两类数据集,背后由 distilabel 和免费的 Hugging Face text-generation API 驱动,文本分类和聊天分别约为每分钟 50 和 20 个样本。
OpenAI 回应马斯克最新法律诉讼,称这是其不到一年内的第四次尝试。OpenAI 表示,马斯克 2017 年不仅想要、而且实际创建了营利性结构作为 OpenAI 当时提议的新架构。
Hugging Face 与 Entalpic 联合推出开源协作项目 LeMaterial,并发布首个数据集 LeMat-Bulk,整合 Materials Project、Alexandria 和 OQMD 三大材料数据库,形成 670 万条条目、7 种材料属性的统一数据格式,采用 CC-BY-4.0 许可。
OpenAI 的视频生成模型 Sora 现已上线 sora.com 供用户使用。用户可生成最高 1080p 分辨率、最长 20 秒的视频,支持宽屏、竖屏和方形画幅。用户可导入自有素材进行扩展、重混和融合,也可完全由文本生成新内容。
推荐理由:OpenAI 官方给出 Sora 的开放入口与分辨率、时长、画幅等具体规格,便于读者判断可用范围。
Hugging Face 的开源模型现已通过 Amazon Bedrock Marketplace 提供,AWS 客户可部署 83 个开源模型构建生成式 AI 应用。
Hugging Face 的 Data is Better Together 社区发布 Apache 2.0 许可的文本到图像偏好数据集,覆盖多种图像生成类别并混合不同模型家族与提示词复杂度。数据集基于 Flux 和 Stable Diffusion 模型生成图像,配套提供 flux-dev-lora-finetune 微调模型及 GitHub 预处理代码。
OpenAI 发布 Sora 系统卡,介绍其视频生成模型 Sora。Sora 支持文本、图像和视频输入,输出新生成的视频,并基于 DALL-E 与 GPT 系列模型的经验构建,用于拓展叙事与创意表达的工具。
推荐理由:OpenAI 官方系统卡披露 Sora 的输入输出形式与模型来源,可了解其视频生成能力边界。
电影制作组合 Vallée Duhamel 讲述了 Sora 如何帮助他们构建新的世界。
电影制作人 Lyndon Barrois 展示了如何将 Sora 用作叙事工具来创造新世界。他分享了使用 Sora 进行故事创作的方法。
OpenAI 发布面向产品团队的 AI 应用指南,帮助产品团队把 AI 投入实际工作。内容围绕如何将 AI 融入产品团队的日常工作展开。
跨学科艺术家 Minne Atairu 讲述 Sora 如何帮助她实现自己的创作构想。
OpenAI 发布 ChatGPT Pro,官方称其用于扩大前沿 AI 的使用范围。该消息来自 OpenAI 官方,原文仅给出这一句说明,未披露价格、具体功能或可用范围。
推荐理由:OpenAI 官方推出 ChatGPT Pro 订阅档,读者可据此了解其订阅体系新增的一档定位。
OpenAI 发布 o1 系统卡,说明在发布 o1 和 o1-mini 之前开展的安全工作,包括外部红队测试以及依据 Preparedness Framework 进行的前沿风险评估。
推荐理由:OpenAI 官方系统卡披露 o1 与 o1-mini 发布前的红队测试和前沿风险评估流程,可了解其安全评估框架。
Google 发布新一代视觉语言模型 PaliGemma 2,沿用 SigLIP 图像编码器并将文本解码器升级为 Gemma 2,提供 3B、10B、28B 三种参数规格,均支持 224x224、448x448、896x896 三种输入分辨率,而上一代 PaliGemma 仅有 3B 版本。