跳到正文

#部署/工程

今日 9 条
9月26日周二
9月22日周五
9月19日周二
9月15日周五
9月13日周三
9月12日周二
9月1日周五
8月30日周三
7月27日周四
  1. Hugging Face Blog62

    Hugging Face 与 Apple 用混合位宽量化把 Stable Diffusion XL 搬上 Mac Core ML

    Hugging Face 与 Apple 将 Stable Diffusion XL 基础模型移植到 Core ML,可在运行 macOS 14 公测版的 Apple Silicon Mac 上通过 Swift 应用或 Hugging Face 演示应用运行,目前使用 ORIGINAL attention 实现,refiner 阶段尚未移植。

    推荐理由:Hugging Face 与 Apple 把 SD XL 移植到 Core ML 并给出混合位宽量化配方,读者可据此判断 Mac 本地跑大模型的可行路径。

7月14日周五
7月5日周三
7月4日周二
7月3日周一
7月1日周六
  1. Hugging Face Blog12

    Hugging Face 对话 Writer CTO:从用户到开源模型贡献者的生成式 AI 规模化实践

    Hugging Face 的 Jeff Boudier 对话 Writer 联合创始人兼 CTO Waseem Alshikh,回顾 Writer 从 Hugging Face 用户、客户到开源模型贡献者的历程。双方还讨论了当前生成式 AI 的最大误区、Writer 贡献开源模型的原因,以及 Writer 如何在 CPU 和 GPU 上规模化部署 LLM、CPU 推理效率对生产的重要性。

6月29日周四
6月22日周四
6月15日周四
  1. Hugging Face Blog62

    用 Core ML 在 iPhone、iPad 和 Mac 上加速 Stable Diffusion

    Hugging Face 介绍了借助 Core ML 新优化在 iPhone、iPad 和 Mac 上加速 Stable Diffusion 的方法,核心是 6-bit palettization 量化,将权重从 16-bit 浮点压到每参数 6 bit,并在推理时逐层解压以节省内存。

    推荐理由:Hugging Face 与 Apple 官方给出 6-bit palettization 的量化原理与转换命令,读者可据此把 Stable Diffusion 压到端侧运行。

6月13日周二
6月2日周五
  1. Hugging Face Blog22

    如何在 Unity 中用 Hugging Face Unity API 实现语音识别

    Hugging Face 发布教程,演示如何借助 Hugging Face Unity API 在 Unity 游戏中实现语音识别,把玩家语音转成文本,可用于下达指令、与 NPC 对话或提升无障碍体验。教程从搭建含开始/停止按钮和 TextMeshPro 文本框的场景入手,用 Microphone.Start() 以 44100 Hz 录制最长 10 秒音频,再编码为 WAV 格式发送给 API。

5月31日周三
5月25日周四
5月24日周三
5月23日周二
5月16日周二
5月15日周一
5月11日周四
  1. Hugging Face Blog62

    Hugging Face 提出辅助生成方法,降低文本生成延迟最高 10 倍

    Hugging Face 发布辅助生成(assisted generation)方法,用一个至少小一个数量级的助手模型生成候选 token,再由主模型一次前向验证,从而减少前向次数、降低文本生成延迟。

    推荐理由:Hugging Face 官方给出辅助生成方法的原理与可复现代码,读者可据此判断低延迟推理的落地条件。

5月1日周一
4月27日周四
4月26日周三
4月17日周一
4月6日周四
3月28日周二
3月23日周四
3月3日周五
3月1日周三
2月23日周四
2月21日周二
2月15日周三
  1. Hugging Face Blog26

    我们为何转向 Hugging Face Inference Endpoints,或许你也应该考虑

    Hugging Face 推出托管服务 Inference Endpoints,可将 Hub 上的模型部署到 AWS、Azure(GCP 即将支持)等多种实例类型上。作者将原本跑在 AWS ECS + Fargate 上的 CPU 推理模型迁移过去,用 RoBERTa 文本分类模型测试显示,large 实例延迟约 80ms,比原方案约 200ms 快一倍以上,但成本高出 24% 至 50%。