Mistral AI 发布 Mistral Medium 3,主打低成本企业级部署
Mistral AI 发布 Mistral Medium 3,称其在多项基准上达到 Claude Sonnet 3.7 的 90% 或以上,价格为每百万 token 输入 0.4 美元、输出 2 美元。
推荐理由:官方给出 Mistral Medium 3 的定价、对标模型与部署门槛,可据此判断企业选型的成本与落地条件。
Mistral AI 发布 Mistral Medium 3,称其在多项基准上达到 Claude Sonnet 3.7 的 90% 或以上,价格为每百万 token 输入 0.4 美元、输出 2 美元。
推荐理由:官方给出 Mistral Medium 3 的定价、对标模型与部署门槛,可据此判断企业选型的成本与落地条件。
Intel 发布权重仅训练后量化方法 AutoRound,通过符号梯度下降联合优化权重舍入与裁剪范围,支持 INT2-INT8 低比特量化。在 INT2 下其相对精度最高达主流基线 2.1 倍,量化 72B 模型在 A100 上仅需 37 分钟(light 模式)。
TNG 在 24 张 H100 GPU 集群上自托管多个大语言模型,支撑 50 个应用、每小时超 5,000 次推理、每天生成超一千万 token,并分析了并发请求下 prefill 与 decode 两阶段的性能差异。
Gradio 不只是构建 UI 的 Python 库,而是通过 UI 和 API 与机器学习模型交互的框架。所有 Gradio 应用自带 API,提供 Python(gradio_client)和 JavaScript(@gradio/client)官方 SDK 及 cURL 访问,并自动生成 REST 端点和 API 文档。
Hugging Face 的 Gradio 月活开发者已超过 100 万,Automatic1111、Oobabooga 的 Text Generation WebUI、Dall-E Mini 和 LLaMA-Factory 等热门开源项目均基于它构建。
TNG Technology Consulting 分享了自托管 LLM 服务中请求排队问题的解决方案:在 vLLM 等推理引擎前加一层 LLM-Server,为每个用户和模型维护独立队列并采用轮询调度,避免"重度用户"阻塞他人。
Hugging Face 将密钥管理从 AWS 单云方案迁移至 Infisical,以支撑其 Hub 上超 400 万构建者的多云端(Azure、GCP)环境。团队通过 Infisical Kubernetes Operator 自动同步密钥更新,并借助 Okta 集成实现细粒度 RBAC,取代了不安全的本地 .env 文件。工程师仍偏好手动重新部署,以应对每分钟超 1000 万请求的高流量场景。
Hugging Face 通过 PR #3091 将 Intel Gaudi 硬件支持原生集成进 Text Generation Inference(TGI),取代此前独立维护的 tgi-gaudi 分支,覆盖 Gaudi1、Gaudi2、Gaudi3 全线硬件。
Gradio 为 gr.Dataframe 组件发布大规模更新,6 周内关闭超 70 个 dataframe 相关问题。新增多单元格选择、行号与列固定(pinned_columns)、复制与全屏按钮、搜索与过滤(show_search)、静态列(static_columns)等功能,并升级键盘导航与样式定制。
Hugging Face 为 Inference Endpoints 上线新版分析面板,指标数据改为实时更新,并重写了后端以加快高流量端点的数据加载。新面板支持自定义时间范围与自动刷新,还新增副本生命周期视图,可追踪每个副本从初始化到终止的每次状态转换。官方表示仍在持续迭代并欢迎用户反馈。
Booking.com 将自身数据系统与 OpenAI 的 LLM 集成,用于提供更智能的搜索、更快的客服支持和意图驱动的旅行体验。
Hugging Face 的 Xet 团队将首批 Model 和 Dataset 仓库从 LFS 迁移到 Xet 存储,迁移了 4.5 TB 数据,约 6% 的 Hub 下载流量转到 Xet 基础设施。
推荐理由:Hugging Face 官方复盘 Xet 存储首次迁移,给出块级去重带来的上传下载变化与迁移中的工程取舍。
Hugging Face 发布教程,演示如何用 React Native 和 llama.rn(llama.cpp 的绑定)构建 Android/iOS 应用,从 Hugging Face hub 下载 GGUF 模型并在设备本地离线运行。
Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序交错提取文本与图像,并已作为 Le Chat 文档理解的默认模型。
推荐理由:官方给出 Mistral OCR 的定价、基准对比与自托管选项,可据此判断它在文档解析与 RAG 流程中的位置。
OpenAI 帮助将工程周期加速 20%。
Hugging Face 博客介绍如何用 Arize Phoenix 为 smolagents 构建的 Agent 做追踪与评估,通过 OpenTelemetry 和 OpenInference 自动捕获每次 Agent 调用。
Hugging Face Diffusers 团队实验性推出 Remote VAE,将扩散模型的 VAE 解码过程委托给远程 Inference Endpoints,以降低高分辨率图像和视频生成对消费级 GPU 的显存压力。
Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三家无服务器推理提供商,支持 DeepSeek-R1、Flux.1 等模型,并已集成 JS 和 Python 客户端 SDK。用户可在账户设置中配置自有 API key 直连提供商,或经 HF 路由计费;PRO 用户每月获 2 美元推理额度。
Mistral AI 发布 Mistral Saba,这是其首个专门面向区域语言的模型,参数规模 24B,训练数据来自中东和南亚。该模型支持阿拉伯语和多种印度源语言,在泰米尔语等南印度语言上表现突出,官方称其回答比规模大 5 倍以上的模型更准确,同时速度更快、成本更低。
推荐理由:Mistral 推出面向中东和南亚的区域语言模型,读者可了解其参数规模、语言覆盖与本地部署方式。
Fireworks.ai 正式成为 Hugging Face Hub 支持的推理服务商,可在模型页面及整个 HF 生态中提供无服务器推理。
Hugging Face 博客实测了 10 亿次分类与嵌入推理的成本:在 nvidia-L4($0.8/hr)上,DistilBERT 情感分类模型处理 10 亿条输入约 $253.82,gte-modernbert-base 嵌入约 $409.44,而 2.21B 参数的 ColQwen2 视觉嵌入高达 $44,496.51。
Hugging Face 的 Xet 团队开源了 xet-core 和与 huggingface_hub 集成的 hf_xet,用 Rust 实现基于内容分块的上传下载方案,部分场景提速 2-3 倍。
OpenAI 面向欧洲客户推出数据驻留功能,作为其企业级数据隐私、安全与合规体系的一部分。该功能支持全球客户,具体上线时间与适用模型未在原文中披露。
Mistral AI 发布 Mistral Small 3,一个面向低延迟优化的 24B 参数模型,以 Apache 2.0 许可证开源,同时提供预训练和指令微调两个 checkpoint。
推荐理由:24B 参数在 Apache 2.0 下对标三倍体量模型,并给出量化后单卡本地部署的具体条件。
Hugging Face 发布指南,介绍如何在 AWS 上部署和微调 DeepSeek R1 系列模型,覆盖 Hugging Face Inference Endpoints、Amazon Bedrock Marketplace、SageMaker AI 的 LLM DLC 以及 EC2 Neuron 等路径。
Hugging Face 在 Hub 模型页上线 Inference Providers,首批接入 fal、Replicate、SambaNova、Together AI 四家无服务器推理服务商,并集成到 JS 和 Python 客户端 SDK。
推荐理由:官方说明 Hub 模型页接入四家无服务器推理服务商,并给出 SDK 与路由代理的调用方式,便于判断接入成本。
Hugging Face 发文梳理开源视频生成模型现状,CogVideoX、Mochi-1、Hunyuan Video、Allegro、LTX Video 均已开放,而 Sora、Veo 2、Gen 3 Alpha、Kling、Pika 2.0、MiniMax 仍为闭源。文章指出开源模型受限于高算力成本、泛化能力不足和生成延迟,Diffusers 团队正从推理优化与微调两方面推进其规模化采用。
NVIDIA 推出 Python 工具包 KVPress,通过多种压缩算法降低长上下文 LLM 的 KV Cache 内存占用。以 Llama 3-70B 在 bfloat16 下处理 1M token 为例,KV Cache 需 327.6GB,占约 470GB 总内存的 70%。
Hugging Face 与 FriendliAI 达成合作,将 FriendliAI Endpoints 集成进 Hugging Face Hub 的“Deploy this model”按钮,实现开源或自定义生成式 AI 模型的一键部署。
OpenAI 官方发布公告,宣布 Stargate 项目。公告未提供更多细节,仅给出项目名称与发布动作。
推荐理由:OpenAI 官方宣布 Stargate 项目,读者可据此了解其自建 AI 基础设施的布局方向。
Hugging Face 发布 TimmWrapper,让任意 timm 视觉模型可直接接入 transformers 生态,支持 pipeline API、Auto 类和 Trainer 微调。
Hugging Face 为 Text Generation Inference(TGI)引入多后端架构,通过统一的 Rust 前端层接入 vLLM、llama.cpp、TensorRT-LLM 等推理引擎,用户可按模型、硬件和性能需求切换后端。
Hugging Face 博客给出用 torch.cuda.memory._record_memory_history 记录并可视化 PyTorch 训练 GPU 显存占用的完整教程,可在 pytorch.org/memory_viz 拖入 profile.pkl 查看内存曲线。
推荐理由:用 PyTorch 内存快照逐段拆解训练显存构成,并给出可套用的估算公式与工具。
NVIDIA 的 LogitsProcessorZoo 是一套模块化 logits 处理器,可控制序列长度、强制关键短语或引导多选题答案,并与 Hugging Face 的 generate 方法完全兼容。
IBM 联合普林斯顿、CMU 和 UIUC 发布 Bamba-9B,一个基于完全开放数据训练的混合 Mamba2 模型,训练数据量 2.2T tokens。在 vLLM 中,该模型相比标准 Transformer 实现 2.5 倍吞吐提升和 2 倍延迟加速,并已支持 transformers、vLLM、TRL 和 llama.cpp。
Hugging Face 用 optimum-benchmark 在 Google Cloud 的 C4(第 5 代 Xeon,Emerald Rapids,支持 AMX)与 N2(第 3 代 Xeon,Ice Lake)实例上对比了文本嵌入与文本生成两项智能体负载。
Hugging Face 的开源模型现已通过 Amazon Bedrock Marketplace 提供,AWS 客户可部署 83 个开源模型构建生成式 AI 应用。
Hugging Face 用 Keras、JAX 和 TPU 搭建了一个 chatbot arena,让多个 LLM 同时处理同一段日历 API 调用对话,测试它们在用户用自然语言指出错误后能否修正代码。实验在 TPU v5e 2x4 上以 bfloat16 同时加载了 5 个约 8B 参数模型和 3 个约 2B 参数模型,共 7 个 LLM,通过 Gradio Spaces 界面并行对话。
Capital Fund Management(CFM)借助 Hugging Face Inference Endpoints 部署 Llama 3.1-70b-Instruct 生成标注、再用 Argilla 人工复核,微调出的小模型在金融命名实体识别上准确率最高提升 6.4%,推理成本较大模型低至 80 倍。
Hugging Face 的 Xet 团队正在重新设计 Hub 的上传与下载架构,计划引入内容寻址存储(CAS)作为内容分发第一站,并基于"读简单、写智能"理念构建自定义协议。新架构在字节级别分析文件,对 tensor 文件(如 Safetensors)的压缩探索有望将上传速度提升 10-25%。CAS 节点将部署在 AWS 少数区域,以覆盖北美、欧洲和亚洲的主要上传流量。