Mistral AI 发布 Mistral Small 3.1,支持多模态与 128k 上下文
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens per second,采用 Apache 2.0 许可。
推荐理由:官方给出 Mistral Small 3.1 的基准对比、128k 上下文与端侧运行门槛,便于判断小模型选型。
跑在手机、电脑与边缘设备上的 AI:小模型、本地推理与端侧芯片的进展。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens per second,采用 Apache 2.0 许可。
推荐理由:官方给出 Mistral Small 3.1 的基准对比、128k 上下文与端侧运行门槛,便于判断小模型选型。
Hugging Face 的 LeRobot 团队与 Yaak 联合发布 L2D(Learning to Drive),称其为全球最大的开源自动驾驶数据集,包含 90+ TB 多模态数据、5000+ 小时驾驶记录,来自德国 30 座城市的 60 辆驾校车辆。
推荐理由:L2D 以 90TB 多模态驾驶数据补齐端到端自动驾驶训练集缺口,并直接接入 LeRobot 训练管线。
Hugging Face 发布 SmolVLM2 系列视频理解模型,提供 2.2B、500M 和 256M 三种参数规模,并称 500M 与 256M 是迄今最小的视频语言模型。
推荐理由:官方给出三种参数规模与 Video-MME 表现,可据此判断小模型端侧视频理解的实际可用边界。
Mistral AI 发布 Mistral Small 3,一个面向低延迟优化的 24B 参数模型,以 Apache 2.0 许可证开源,同时提供预训练和指令微调两个 checkpoint。
推荐理由:24B 参数在 Apache 2.0 下对标三倍体量模型,并给出量化后单卡本地部署的具体条件。
Hugging Face 发布 Transformers.js v3,新增 WebGPU 支持,官方称比 WASM 快最多 100 倍,加载模型时设置 device: 'webgpu' 即可启用。
推荐理由:官方给出 WebGPU 加速、量化格式与 120 个架构支持的具体变化,可据此判断浏览器端推理的可用边界。
Mistral AI 在 Mistral 7B 发布一周年之际推出两款面向端侧与本地推理的模型 Ministral 3B 和 Ministral 8B,官方称其在 10B 以下级别刷新了知识、常识、推理、函数调用和效率的表现。
推荐理由:官方给出两款端侧小模型的能力定位、上下文长度与 API 定价,可据此判断本地推理的选型与成本。
Meta 发布 Llama 3.2 系列共十款开放权重模型,包括 5 款多模态视觉模型和 5 款纯文本模型,均已上线 Hugging Face Hub。
推荐理由:Hugging Face 官方给出 Llama 3.2 十款开源权重的规格、基准与端侧运行方式,可据此判断多模态与 1B/3B 小模型的落地路径。
Google 在 Gemma 2 发布一个月后扩充 Gemma 模型系列,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器 ShieldGemma 以及稀疏自编码器套件 Gemma Scope。
推荐理由:Google 一次补齐 Gemma 2 的小尺寸、安全分类器和可解释性工具,读者可据此判断端侧部署与内容审核的可用选项。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用不到 4GB 内存完成 7B 参数模型的推理。
推荐理由:Hugging Face 官方给出把 Mistral 7B 转成 Core ML 并跑在 Mac 上的完整步骤,可据此复现端侧部署流程。
Hugging Face 发布 SmolLM 系列小语言模型,包含 135M、360M 和 1.7B 三个参数规模,并同步开源训练语料 SmolLM-Corpus。
推荐理由:官方披露了 135M 到 1.7B 三档小模型的训练数据构成与同尺寸对比结果,可据此判断端侧部署的可行边界。
Hugging Face 发布 swift-transformers Swift 包及配套工具,让开发者能在 Apple 设备上通过 Core ML 运行 Llama 2、Falcon 等模型。
推荐理由:Hugging Face 发布 Swift 端侧 LLM 工具链,读者可了解在 Apple 设备上跑 Llama 2 的完整路径与当前限制。
Hugging Face 介绍了借助 Core ML 新优化在 iPhone、iPad 和 Mac 上加速 Stable Diffusion 的方法,核心是 6-bit palettization 量化,将权重从 16-bit 浮点压到每参数 6 bit,并在推理时逐层解压以节省内存。
推荐理由:Hugging Face 与 Apple 官方给出 6-bit palettization 的量化原理与转换命令,读者可据此把 Stable Diffusion 压到端侧运行。
借助 Apple 工程师提供的转换脚本和推理代码,Stable Diffusion 现在可以在 Apple Silicon 上通过 Core ML 运行,Hugging Face 已把 Stable Diffusion v1.4、v1.5、v2 base 和 v2.1 base 的权重转换好并放到 Hugging Face Hub。
推荐理由:原文给出在 Apple Silicon 上用 Core ML 跑 Stable Diffusion 的完整流程,含模型变体选择与实测耗时。