Falcon-Edge 发布 1B 与 3B 三值量化语言模型系列
Falcon-Edge 系列发布,基于 BitNet 架构,提供 1B 和 3B 两种规模,每种规模都有 base 与指令微调版本,权重以三值格式({-1, 0, 1})提供。
推荐理由:Falcon-Edge 用一次预训练同时产出 bfloat16 与三值量化版本,并给出可直接微调的权重与工具包,读者可据此判断 1.58bit 模型的落地路径。
Falcon-Edge 系列发布,基于 BitNet 架构,提供 1B 和 3B 两种规模,每种规模都有 base 与指令微调版本,权重以三值格式({-1, 0, 1})提供。
推荐理由:Falcon-Edge 用一次预训练同时产出 bfloat16 与三值量化版本,并给出可直接微调的权重与工具包,读者可据此判断 1.58bit 模型的落地路径。
Hugging Face 宣布将 Transformers 打造为跨框架的模型定义中枢,模型架构只要被 Transformers 支持,就能在生态其他工具中获得支持。目前 Transformers 已支持 300+ 模型架构,平均每周新增约 3 个,并与 vLLM、SGLang、TGI 等推理引擎及 llama.cpp、MLX 打通互操作。官方还计划简化建模代码、弃用冗余组件,降低社区贡献门槛。
推荐理由:Hugging Face 官方说明 Transformers 将作为跨框架的模型定义中枢,读者可据此理解模型一次贡献、多引擎复用的生态走向。
Expedia Group 首席营销官 Jochen Koedijk 与 OpenAI 对话,讲述 AI 如何推动 Expedia 的营销演进。
Hugging Face 与 Kaggle 推出集成,Kaggle 用户可直接在平台上发现并使用 Hugging Face 模型,如在 Qwen/Qwen3-1.7B 等模型页点击“Use this model”选择 Kaggle 即可生成含加载代码的 Notebook。
Hugging Face 在 Inference Endpoints 上线新版 OpenAI Whisper 部署方案,基于 vLLM 实现,性能较此前版本最高提升 8 倍,转录质量无损。
OpenAI 推出医疗 AI 评估基准 HealthBench,用于在真实场景中评测模型表现。该基准由 250+ 位医生参与构建,旨在为医疗领域的模型性能与安全性提供统一标准。
Hugging Face 发布博客盘点过去一年视觉语言模型的关键变化,涵盖 any-to-any、推理、小尺寸、MoE 解码器、视觉语言动作模型等新趋势。
Hugging Face 的 LeRobot 项目正推动社区共建机器人数据集,将其定位为机器人领域的“ImageNet”,目前 Hub 上的 lerobot 数据集数量快速增长,贡献主要集中在 So100 和 Koch 机械臂。项目通过简化录制流程、打通上传至 Hugging Face Hub、降低硬件成本来扩大数据多样性,并指出数据整理(curation)是下一阶段的核心挑战。
OpenAI 宣布扩充领导层,Fidji Simo 加入公司。Sam 当天早些时候已向全员发送了相关消息。
OpenAI 就能源部关于 AI 基础设施的议题作出回应,强调基础设施决定命运,并阐述美国应如何把握这一机遇。
OpenAI 在亚洲推出数据驻留功能,延续其面向全球客户的企业级数据隐私、安全与合规体系。
Mistral 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业级 AI 助手,提供企业搜索、Agent 构建器、自定义数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内逐步上线。
推荐理由:Mistral 把企业搜索、Agent 构建与混合部署打包进同一平台,可据此判断企业级 AI 助手的集成路径。
Mistral AI 发布 Mistral Medium 3,称其在多项基准上达到 Claude Sonnet 3.7 的 90% 或以上,价格为每百万 token 输入 0.4 美元、输出 2 美元。
推荐理由:官方给出 Mistral Medium 3 的定价、对标模型与部署门槛,可据此判断企业选型的成本与落地条件。
圣安东尼奥马刺队正使用定制 GPT 提升球迷互动、简化运营,并推动各团队创新。
Lowe's 与 OpenAI 合作构建了 Mylow 和 Mylow Companion 两款 AI 工具,为顾客和门店员工提供专家级家装项目协助。这两款工具旨在让复杂的家居改造项目更易规划、推进和完成。
OpenAI 发起 OpenAI for Countries 新计划,支持希望基于民主 AI 基础设施进行建设的国家。该计划面向全球各国,具体支持方式与参与细节尚未在文中披露。
OpenAI 推出 AI stories,聚焦 AI 为人们带来的日常收益,并借此揭示更大的机会。Sam Altman 曾写道,人类正进入 Intelligence Age,AI 将帮助人们变得远为能干,科学、医学、教育、国防等当今最大难题将不再无解,新的可能性与繁荣空间将随之打开。
John Deere 的 Justin Rose 分享了公司如何借助 OpenAI 的 AI 技术推动农业转型,并规模化创新,帮助农民更智能、更高效、更可持续地作业。
OpenAI 董事会发布更新,宣布将营利实体转型为公益公司(Public Benefit Corporation),在非营利监管下强化其使命驱动的架构。该调整旨在扩大影响力,并与公共利益保持长期一致。
推荐理由:OpenAI 董事会说明营利实体转为公益公司,读者可了解其非营利监管架构的调整方向。
Lowe's 数据、AI 与创新高级副总裁 Chandhu Nair 分享了这家家居建材零售商如何借助 AI 推动业务。对话内容围绕 Lowe's 在零售场景中的 AI 应用展开。
OpenAI 就模型谄媚(sycophancy)问题发布进一步说明,复盘此前发现中出错的原因,并公布后续将做出的调整。
Gradio 官方教程介绍如何用几行 Python 把 Gradio 应用变成 MCP Server,只需在 launch() 中设置 mcp_server=True,函数即被自动转换为 LLM 可调用的工具,docstring 会生成工具描述和参数。
推荐理由:Gradio 官方给出把任意 Python 函数变成 MCP 工具的最短路径,可据此判断自家应用接入 LLM 工具调用的成本。
Qwen-3 的 chat template 相比 Qwen-2.5 和 QwQ 有四处关键变化:通过 enable_thinking 标志可开关推理,不再强制输出思维链。
OpenAI 已回滚上周的 GPT-4o 更新,ChatGPT 用户现在使用的是行为更平衡的早期版本。被移除的更新表现为过度奉承或顺从,常被描述为迎合(sycophantic)。
推荐理由:官方说明 GPT-4o 更新因过度迎合被回滚,读者可了解这次行为调整的起因与处理方式。
Meta 发布 Llama Guard 4,一个 12B dense 多模态安全模型,以及两个新的 Llama Prompt Guard 2 模型,模型 checkpoint 已上线 Hugging Face Hub 的 Llama 4 Collection。
推荐理由:Meta 开源多模态安全模型,给出架构剪枝思路与相对上一代的召回对比,可据此评估内容审核管线。
Intel 发布权重仅训练后量化方法 AutoRound,通过符号梯度下降联合优化权重舍入与裁剪范围,支持 INT2-INT8 低比特量化。在 INT2 下其相对精度最高达主流基线 2.1 倍,量化 72B 模型在 A100 上仅需 37 分钟(light 模式)。
ServiceNow 开源实验性 RL 实现 PipelineRL,通过训练中 inflight 权重更新,在不停推理的前提下持续保持最优 batch size,缓解高吞吐推理与 on-policy 数据采集之间的取舍。
Hugging Face 发布 Tiny Agents,用约 50 行 TypeScript 代码实现一个由 MCP 驱动的智能体。
推荐理由:作者用 50 行代码把 MCP 客户端与 Agent 循环讲清楚,读者可据此理解工具调用如何接入现有推理客户端。
ChatGPT for Business 迎来 4 月更新,新增 o3 模型、图像生成、增强记忆和内部知识功能。官方同步放出了这些新能力的实操演示视频。
TNG 基于 olmOCR-7B-0225-preview 微调出一款忠实 OCR 引擎,解决了原模型为生成训练数据而忽略页眉页脚信息的问题。团队用 Qwen2.5-VL-72B-Instruct 生成 8000 份文档数据集,在 8xH100 节点上训练 2.5 个 epoch,使模型能完整提取发票等文档的页眉页脚内容并保留表格解析能力。微调模型已在 Hugging Face 开源。
Speak 正借助 AI 为语言学习提供个性化体验,其 CEO 兼联合创始人 Connor Zwick 在对话中介绍了相关做法。
《华盛顿邮报》与 OpenAI 达成合作,将其新闻内容整合进 ChatGPT,为用户提供摘要、引语和原文报道的直接链接。
TNG 在 24 张 H100 GPU 集群上自托管多个大语言模型,支撑 50 个应用、每小时超 5,000 次推理、每天生成超一千万 token,并分析了并发请求下 prefill 与 decode 两阶段的性能差异。
OpenAI 发布 o3 和 o4-mini 的系统卡,称两款模型将前沿推理能力与完整工具能力结合。可用工具包括网页浏览、Python、图像与文件分析、图像生成、canvas、自动化、文件搜索和记忆。
推荐理由:官方系统卡披露 o3 与 o4-mini 的推理能力与工具调用范围,可对照此前模型看能力边界。
Gradio 不只是构建 UI 的 Python 库,而是通过 UI 和 API 与机器学习模型交互的框架。所有 Gradio 应用自带 API,提供 Python(gradio_client)和 JavaScript(@gradio/client)官方 SDK 及 cURL 访问,并自动生成 REST 端点和 API 文档。
普林斯顿团队发布 HELMET 长上下文语言模型评测基准,已评估 59 个近期 LCLM,并将在 ICLR 2025 展示。该基准针对现有评测过度依赖 NIAH 等合成任务、与实际下游表现相关性差的问题,从多样性、可控性和可靠性三方面改进。
Cohere 正式接入 Hugging Face Inference Providers,成为首个在 HF Hub 上直接分享并托管自家模型的模型厂商。
OpenAI 任命四位新顾问,为其慈善事业提供指导。
OpenAI 发布更新版 Preparedness Framework,用于衡量和防范前沿 AI 能力带来的严重危害。该框架聚焦前沿 AI 能力可能造成的严重风险,并给出相应的测量与防护方法。
OpenAI 在 API 中发布 GPT-4.1 系列模型,官方称其在编码、指令遵循和长上下文理解上有全面提升,并同步推出首个 nano 模型。该系列即日起面向全球开发者开放。
推荐理由:OpenAI 在 API 中上线 GPT-4.1 系列并首次推出 nano 版本,读者可了解其在编码与长上下文上的改进方向。