跳到正文

#部署/工程

今日 3 条
3月11日周三
3月10日周二
3月9日周一
3月5日周四
  1. Hugging Face Blog34

    如何在嵌入式平台部署机器人 AI:数据集录制、VLA 微调与端侧优化

    Hugging Face 博客发布 NXP 的嵌入式机器人 AI 实践指南,涵盖机器人数据集录制、VLA 策略微调(ACT 与 SmolVLA)以及端侧优化。NXP 以"把茶包放进杯子"任务为例,用 3 个摄像头(顶部、夹爪、左侧)录制 120 个 episode,并指出异步推理需让端到端延迟短于动作执行时长。指南还介绍了 NXP i.MX 95 SoC 优化后的实时性能表现。

2月28日周六
2月27日周五
2月26日周四
2月23日周一
2月20日周五
2月19日周四
2月13日周五
  1. Hugging Face Blog62

    Hugging Face 发布 CUDA kernel agent skill,Claude 与 Codex 端到端生成可用内核

    Hugging Face 构建了一个 agent skill,教编码智能体编写生产级 CUDA kernel,并用 Claude 和 Codex 在 diffusers 与 transformers 两个真实目标上端到端生成了可用的 kernel、PyTorch 绑定和基准测试。

    推荐理由:Hugging Face 把 CUDA kernel 开发知识打包成 agent skill,并给出两个真实目标的端到端基准数据,可迁移到其他领域技能设计。

2月9日周一
2月6日周五
2月5日周四
2月3日周二
1月27日周二
1月23日周五
1月22日周四
1月21日周三
1月20日周二
1月15日周四
1月14日周三
1月9日周五
1月8日周四
12月17日周三
  1. Mistral AI66

    Mistral 发布 OCR 3,表单与手写识别胜率较上代提升 74%

    Mistral AI 发布 Mistral OCR 3,在表单、扫描文档、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,并称其准确率超过企业文档处理方案与 AI 原生 OCR 方案。

    推荐理由:官方给出与上一代在表单、手写和表格上的胜率对比,以及每千页定价,可据此判断文档解析成本与适用场景。

12月11日周四
  1. Hugging Face Blog62

    llama.cpp server 新增 router 模式,支持动态加载与切换多个模型

    llama.cpp server 新增 router 模式,无需重启即可动态加载、卸载和切换多个模型,实现类似 Ollama 的模型管理。该模式采用多进程架构,每个模型独立运行,单个模型崩溃不影响其他模型;模型按需加载,超过 --models-max(默认 4)时按 LRU 策略卸载最久未用的模型。

    推荐理由:llama.cpp server 新增 router 模式,读者可据此了解本地多模型热切换与显存回收的具体做法。

12月5日周五
  1. Hugging Face Blog40

    Hugging Face 发布 swift-huggingface:完整的 Swift 客户端

    Hugging Face 推出 swift-huggingface,一个面向 Hub 的完整 Swift 客户端包,可独立使用,后续将并入 swift-transformers 替换现有 HubApi。它提供完整 Hub API 覆盖、断点续传与进度追踪、与 Python 兼容的共享缓存,以及 TokenProvider 认证和 OAuth 2.0 支持,基于分块去重的 Xet 存储后端即将上线。

12月1日周一
11月26日周三
11月25日周二
  1. Hugging Face Blog22

    从第一性原理理解 continuous batching

    Hugging Face 发布博客,从 attention 机制与 KV caching 出发,通过优化吞吐量推导出 continuous batching。该方法通过并行处理多个对话、完成即换出,来提升高负载场景下的推理性能。文中指出 attention 是 token 间唯一交互之处,其计算量随序列长度呈平方增长。

  2. Hugging Face Blog40

    Hugging Face 如何打造达到 SOTA 的深度研究智能体

    Hugging Face 分享构建 SOTA 深度研究智能体的经验:七个月前其首版架构因假设过于复杂,在新一代模型到来后成为瓶颈,被迫推倒重建。团队转向更简化的编排逻辑并依赖模型自主性,同时借助 Tavily Advanced Search 在工具侧完成上下文工程,只返回最相关内容块以降低幻觉与延迟。

11月20日周四