Mistral 如何用 LLM as a Judge 评估 RAG 系统
Mistral 提出用 LLM as a Judge 评估 RAG 系统,由 judge LLM 按数值、二元或定性量表为 generator LLM 的回答打分,再对评测数据集求加权平均。
Mistral 提出用 LLM as a Judge 评估 RAG 系统,由 judge LLM 按数值、二元或定性量表为 generator LLM 的回答打分,再对评测数据集求加权平均。
Hugging Face 的 Gradio 月活开发者已超过 100 万,Automatic1111、Oobabooga 的 Text Generation WebUI、Dall-E Mini 和 LLaMA-Factory 等热门开源项目均基于它构建。
Hugging Face 将已有 3 年历史的 NLP Course 更名为 LLM Course,并新增微调 LLM、构建 Deepseek R1 等推理模型的章节。
TNG Technology Consulting 分享了自托管 LLM 服务中请求排队问题的解决方案:在 vLLM 等推理引擎前加一层 LLM-Server,为每个用户和模型维护独立队列并采用轮询调度,避免"重度用户"阻塞他人。
Hugging Face 将密钥管理从 AWS 单云方案迁移至 Infisical,以支撑其 Hub 上超 400 万构建者的多云端(Azure、GCP)环境。团队通过 Infisical Kubernetes Operator 自动同步密钥更新,并借助 Okta 集成实现细粒度 RBAC,取代了不安全的本地 .env 文件。工程师仍偏好手动重新部署,以应对每分钟超 1000 万请求的高流量场景。
Sentence Transformers 库可用于微调 reranker(Cross Encoder)模型,使其在自有数据上超越所有现有方案,也能从零训练出强力的新 reranker。
Hugging Face 博客介绍了如何在本地通过 LM Studio 和 VS Code 的 Continue 扩展运行 OlympicCoder 7B 编程模型,推荐使用 4bit GGUF 量化版本。该模型在 LiveCodeBench 评测中表现优于 Claude 3.7 Sonnet 和 GPT-4o,基于 CodeForces-CoTs 数据集优化,适合处理竞赛类编程难题。
Hugging Face 发布教程,演示如何用 React Native 和 llama.rn(llama.cpp 的绑定)构建 Android/iOS 应用,从 Hugging Face hub 下载 GGUF 模型并在设备本地离线运行。
Mistral AI 推出 TranscriptToPRDTicket 智能体工作流,由 Mistral Large 2 驱动的 PRDAgent 和 TicketCreationAgent 组成,可将会议转录自动生成 PRD 并转化为结构化开发工单,自动在 Linear、Jira 等项目管理工具中创建工单。
Hugging Face 博客介绍如何用 Arize Phoenix 为 smolagents 构建的 Agent 做追踪与评估,通过 OpenTelemetry 和 OpenInference 自动捕获每次 Agent 调用。
Hugging Face 博客实测了 10 亿次分类与嵌入推理的成本:在 nvidia-L4($0.8/hr)上,DistilBERT 情感分类模型处理 10 亿条输入约 $253.82,gte-modernbert-base 嵌入约 $409.44,而 2.21B 参数的 ColQwen2 视觉嵌入高达 $44,496.51。
Hugging Face 发布一套三阶段视频数据集构建工具链,涵盖 yt-dlp 下载、Video to Scenes 切分、水印/美学/NSFW/运动评分过滤,以及 Florence-2 与 Qwen2.5 打标。团队用该工具构建 crush-smol-v0 等数据集,并以 finetrainers 微调 CogVideoX-5B 生成 Pika 风格特效。
Hugging Face 博客发布 Mini-R1 教程,用 GRPO 和 Countdown Game 在 Qwen2.5-3B-Instruct 上复现 DeepSeek R1 的 aha moment。
推荐理由:完整复现流程与训练观察记录,可看到小模型在 GRPO 下从文字推理转向程序化求解的过程。
Hugging Face 发布指南,介绍如何在 AWS 上部署和微调 DeepSeek R1 系列模型,覆盖 Hugging Face Inference Endpoints、Amazon Bedrock Marketplace、SageMaker AI 的 LLM DLC 以及 EC2 Neuron 等路径。
Hugging Face 发文梳理开源视频生成模型现状,CogVideoX、Mochi-1、Hunyuan Video、Allegro、LTX Video 均已开放,而 Sora、Veo 2、Gen 3 Alpha、Kling、Pika 2.0、MiniMax 仍为闭源。文章指出开源模型受限于高算力成本、泛化能力不足和生成延迟,Diffusers 团队正从推理优化与微调两方面推进其规模化采用。
NVIDIA 推出 Python 工具包 KVPress,通过多种压缩算法降低长上下文 LLM 的 KV Cache 内存占用。以 Llama 3-70B 在 bfloat16 下处理 1M token 为例,KV Cache 需 327.6GB,占约 470GB 总内存的 70%。
Hugging Face 发布 TimmWrapper,让任意 timm 视觉模型可直接接入 transformers 生态,支持 pipeline API、Auto 类和 Trainer 微调。
Hugging Face 发布方法,用 Sentence Transformers 训练静态嵌入模型,在 CPU 上比主流嵌入模型快 100 到 400 倍,同时保留大部分质量。
推荐理由:原文公开了静态嵌入模型的完整训练配方与两个已发布模型,读者可据此在 CPU 端复现高效嵌入方案。
Hugging Face 博客给出用 torch.cuda.memory._record_memory_history 记录并可视化 PyTorch 训练 GPU 显存占用的完整教程,可在 pytorch.org/memory_viz 拖入 profile.pkl 查看内存曲线。
推荐理由:用 PyTorch 内存快照逐段拆解训练显存构成,并给出可套用的估算公式与工具。
NVIDIA 的 LogitsProcessorZoo 是一套模块化 logits 处理器,可控制序列长度、强制关键短语或引导多选题答案,并与 Hugging Face 的 generate 方法完全兼容。
Hugging Face 用 optimum-benchmark 在 Google Cloud 的 C4(第 5 代 Xeon,Emerald Rapids,支持 AMX)与 N2(第 3 代 Xeon,Ice Lake)实例上对比了文本嵌入与文本生成两项智能体负载。
Hugging Face 用 Keras、JAX 和 TPU 搭建了一个 chatbot arena,让多个 LLM 同时处理同一段日历 API 调用对话,测试它们在用户用自然语言指出错误后能否修正代码。实验在 TPU v5e 2x4 上以 bfloat16 同时加载了 5 个约 8B 参数模型和 3 个约 2B 参数模型,共 7 个 LLM,通过 Gradio Spaces 界面并行对话。
Capital Fund Management(CFM)借助 Hugging Face Inference Endpoints 部署 Llama 3.1-70b-Instruct 生成标注、再用 Argilla 人工复核,微调出的小模型在金融命名实体识别上准确率最高提升 6.4%,推理成本较大模型低至 80 倍。
Hugging Face 发布开源开发者 EU AI Act 合规指南,梳理该法规对开源 AI 模型与系统的适用范围。仅通用目的 AI(GPAI)模型被直接监管,训练算力超 10^25 FLOPs 者构成系统性风险;有限风险系统须向用户披露其正在与 AI 交互。
Hugging Face 博客通过逐步改进位置编码方案,最终推导出 Llama 3.2 及多数现代 Transformer 使用的 RoPE(旋转位置编码)。文章以 Llama 3.2 1B 为例演示:不加位置信息时,多头自注意力对同一 token 在不同位置的输出完全相同。作者提出位置编码应满足唯一性、线性关系、长度泛化、确定性生成和可扩展至多维等五项理想属性。
Hugging Face 发布博客详解 LayerSkip 提出的自推测解码,用同一 LLM 的早期层生成 draft token、深层网络负责验证,无需额外小模型即可加速文本生成并降低显存占用。
Digital Green 在 CGIAR 主导的 GAIA 项目中开发了农业问答机器人 Farmer.chat,并联合 Hugging Face 专家搭建 LLM-as-a-Judge 评估体系来评测其 RAG 管线。
Hugging Face 发布 Speech-to-Speech(S2S)项目,通过 VAD、STT、语言模型和 TTS 组成的级联流水线实现语音对话,支持英语、法语、西班牙语、中文、日语和韩语,可单语言运行或用 auto 标志自动检测语言。
Llama 3.2 在 Hugging Face / Transformers 上线两周后,Keras 已从第一天起支持加载 Llama 3.2 checkpoint,包括 meta-llama/Llama-3.2-1B-Instruct,无需转换即可通过 keras_hub 的 Llama3CausalLM.from_preset 直接调用。
Hugging Face 修复了 transformers Trainer 中梯度累积的损失计算错误:此前开启梯度累积与全批量训练的损失不一致,正确做法应为累积步内所有批次总损失除以全部非 padding token 数,而非各批次损失的平均值。
Hugging Face 联合 Dask 展示用 Dask DataFrame 并行化 pandas,将 FineWeb 数据集的教育价值分类从本地 100 行扩展到云端多 GPU 上的 2.11 亿行。该流程用 FineWeb-Edu classifier 对 432 GB、250 个 Parquet 文件打分,并通过 map_partitions 实现多节点 GPU 并行推理。
Intel Labs 与 Hugging Face 提出动态推测解码方法,可根据助手模型置信度逐 token 动态调整推测前瞻长度,文本生成最高提速 2.7 倍。
Hugging Face 的 Xet 团队针对 Hub 上超 2.2PB 的 Parquet 存储测试了字节级 CDC 去重效果:追加 10,000 行可去重 99.1%,仅需额外 20MB;但修改一行因列头含绝对偏移量,去重率降至 89%,需额外 230MB。团队提出改用相对偏移量、按行组做内容定义分块等方案,并希望与 Apache Arrow 合作落地。
Hugging Face 发布教程与 InstantTexture 库,可将 InstantMesh 等生成模型输出的顶点着色网格转换为 UV 贴图纹理网格。流程用 xatlas 生成 UV 映射,再通过重心坐标插值填充 1024 像素纹理,并配合修复、中值滤波、高斯模糊与 LANCZOS 降采样消除空洞。该库可通过 pip 安装,将 .obj 网格转换为 .glb 输出。
Hugging Face 与 Intel 合作的 Optimum-Intel 支持将 Transformers 模型导出为 OpenVINO IR,并通过 OpenVINO GenAI 的 LLMPipeline 在 C++ 或 Python 中部署。
Hugging Face 团队探索出把已有模型微调到 1.58bit 的方法,成功将 Llama3 8B 微调为三值权重模型,并在 MMLU 上超过 Llama 1 7B。
推荐理由:作者公开了把已有 Llama3 8B 微调到 1.58bit 的完整技巧与踩坑过程,可迁移到其他模型的低比特微调。
Hugging Face 的 LeRobot 项目提出 LeRobotDataset 格式,用视频编码存储机器人数据集的视觉模态,平均体积仅为原始版本的 14%,最佳情况下可低至 0.2%,同时保持完整训练能力。解码单帧耗时与加载压缩图片相当,连续多帧解码仅需其 25%-50%。该格式轻量、易分享,并原生集成 Hub,还提供可视化工具浏览数据集。
Hugging Face 博客盘点了 Hub 上 5 个常被忽视的工具:ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas。
Hugging Face 发布教程,介绍如何用 TGI 和 Deep Learning Containers 在 Google Cloud Vertex AI 上部署 Meta Llama 3.1 405B。
Hugging Face 复现 Google 的 Infini-Attention 发现,随着记忆压缩次数增加,模型性能持续下降,且 90% 的调试时间花在收敛问题上。