用 Amazon Quick 和 Adjudicated Query 模式批量核查数千份租约合规性
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言转为固定类型操作并复述结果。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言转为固定类型操作并复述结果。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 训练,已在 Asta 的 Generate a report 功能中作为 Fast mode 上线,与 Claude 驱动的 Thinking mode 并列。
推荐理由:原文给出了从 Qwen3-8B 出发的 SFT 与 DPO 数据构造细节,以及引用密度过滤带来增益的对比经验。
Amazon Bedrock Knowledge Bases 可通过 AgenticRetrieveStream API 用自然语言查询理赔文档,支持多轮追问、按 claim ID 和 claim type 等元数据过滤检索,并返回带引用的答案。
基于 Amazon Quick 与 Amazon Bedrock AgentCore 的合同智能平台,用 AI 智能体从合同 PDF 中抽取 8 个关键字段并附置信度,再由 Claude Haiku 验证智能体独立复核,签名识别分歧时由 Amazon Textract 用计算机视觉做确定性裁决。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需人来负责,但审查力度应随风险而定;Skills 与 MCP 解决的是不同问题,MCP 提供连接工具和数据的标准,Skills 则封装团队流程与最佳实践;RAG 并未消亡,它与 Agent、Skills、MCP 可以共存于同一工作流。
Hugging Face 推出 NeoMME 系列多语言多模态编码器,含 260M 和 800M 两个规模,用单个双向 Transformer 同时处理文本 token 与 32×32 图像 patch,无需独立视觉塔或因果语言模型。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,支持 ColBERT 式后期交互检索,并提供完整训练方案。作者用单张 RTX 3090 训练 14.5 小时得到的 mLateOn-medical 模型,在平均 941 token 的医学检索评测上超过所有通用检索模型,截断文档最多损失 0.24 NDCG@10。
Papers with Code 采用混合搜索系统,用 PostgreSQL 全文检索加 pgvector 向量召回,并通过 RRF 融合两路结果。
Mistral 发布 Agentic Search,一个面向企业复杂文档的多步检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries 中。
推荐理由:原文给出多步检索循环的工具设计与两组基准数字,可对照一次性 RAG 理解检索层的变化。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,PyLate 与 Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也能通过同一套 API 使用。
推荐理由:Sentence Transformers v6.0 新增多向量编码器,读者可据此判断晚交互检索的接入方式与索引成本。
Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言、10 个语系,可打包进单个容器完全自托管。该模型在 OlmOCRBench 上取得 85.20 的总体最高分,OmniDocBench 得分 93.07,独立标注者在 600 多份文档的盲评中平均 72% 的情况下更偏好其输出。
推荐理由:OCR 4 把边界框、块分类和置信度分数一并输出,读者可据此判断文档解析如何接入 RAG 与智能体流程。
Google 在 Gemini Enterprise Agent Platform 上推出由 Agentic RAG 驱动的 Cross-Corpus Retrieval 公开预览版,通过 Orchestrator、Planner、Query Rewriter、Search Fanout 与 Sufficient Context Agent 等角色协作处理多源多跳查询。
推荐理由:Google 公布 Agentic RAG 的充足上下文机制与跨语料检索数据,可据此判断多源多跳检索的落地方式。
JetBrains 发布 Mellum2,一个从零训练的 12B 参数 Mixture-of-Experts 模型,覆盖自然语言与代码,每个 token 仅激活 2.5B 参数,以 Apache 2.0 许可开源。官方称其面向路由、RAG、摘要、子智能体和高吞吐编码等低延迟场景,相比同规模模型推理速度提升 2 倍以上。模型已在 Hugging Face 开放下载,架构、训练与评测细节见技术报告。
推荐理由:JetBrains 开源 12B MoE 模型,激活 2.5B 参数并主打 2 倍以上推理速度,可据此判断轻量模型在 RAG 与子智能体中的定位。
Mistral AI 发布 Search Toolkit 公开预览版,这是一个用于构建生产级搜索管线的可组合框架,把摄取、检索和评估统一到共享接口下,并已开源、可部署在云、本地或边缘。
推荐理由:Mistral 把摄取、检索与评估收进同一框架,读者可据此判断自建 RAG 检索链路的整合成本。
Hugging Face 发布 Ettin Reranker 系列六款 Sentence Transformers CrossEncoder 重排序模型,参数规模覆盖 17m、32m、68m、150m、400m 到 1b,均基于 Ettin ModernBERT 编码器构建。
PaddleOCR 3.5 发布,支持通过设置 engine="transformers" 将 Hugging Face Transformers 作为推理后端运行 PP-OCRv5、PaddleOCR-VL 1.5 等模型。
Hugging Face 发布两款基于 ModernBERT 的 Apache 2.0 多语言嵌入模型 granite-embedding-97m-multilingual-r2 和 granite-embedding-311m-multilingual-r2。
Sentence Transformers 现已支持训练和微调多模态嵌入与重排序模型,作者以 Qwen/Qwen3-VL-Embedding-2B 微调视觉文档检索(VDR)为例,微调后 NDCG@10 从基座的 0.888 提升至 0.947,超过其测试的所有现有 VDR 模型,包括参数量达其 4 倍的模型。
Sentence Transformers v5.4 更新后,可用同一套 API 编码和比较文本、图像、音频与视频,并支持多模态嵌入与重排模型。嵌入模型把不同模态映射到共享向量空间,重排模型对混合模态输入对打分,可用于视觉文档检索、跨模态搜索和多模态 RAG。
推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此判断跨模态检索如何接入现有 RAG 流程。
NVIDIA 发布教程,介绍用单张 GPU 在不到一天内把通用嵌入模型微调为领域专用模型,全程无需人工标注。流程基于 NeMo Data Designer 生成合成问答对、用难负样本挖掘做对比学习,微调 Llama-Nemotron-Embed-1B-v2,在 NVIDIA 公开文档数据集上 Recall@10 与 NDCG@10 提升超过 10%。
推荐理由:NVIDIA 公开了从合成数据生成到 NIM 部署的完整嵌入模型微调流程,并给出可复现的评测数字。
Google 与康奈尔大学合作在 PNAS 发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由国际专家小组按六项指标盲评打分。
Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用公开与私有数据集混合的方式评估嵌入模型的真实检索泛化能力。该基准覆盖 20 种语言,聚焦法律、医疗、代码、金融等企业领域,默认榜单指标为 NDCG@10,私有数据集由 MTEB 维护者评测,部分模型在私有集上出现明显性能下滑。
Hugging Face 发布低代码/无代码框架 SyGra,用于为 LLM 和 SLM 生成、转换与对齐数据集。该框架以 Python 库形式提供,支持 vLLM、Hugging Face TGI、Triton、Ollama 等多种推理后端,可覆盖 Q&A 生成、SFT 到 DPO 偏好对构建、推理增强、多语言转换及质量过滤等场景。
Google 发布 EmbeddingGemma,一款面向端侧场景的多语言嵌入模型,参数量 308M,上下文窗口 2K,支持 100 多种语言,量化后内存占用低于 200MB。
推荐理由:308M 参数、2K 上下文、支持 100 多种语言,可据此判断端侧 RAG 与多语言检索的落地空间。
Sentence Transformers 现已支持训练和微调稀疏嵌入模型,可产出如 sparse-encoder/example-inference-free-splade-distilbert-base-uncased-nq 这类低成本模型,尤其适合混合检索或先检索后重排场景。
Mistral AI 发布首个专为代码设计的嵌入模型 Codestral Embed,官方称其在真实代码检索任务上显著优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
推荐理由:官方给出代码嵌入模型在检索任务上的对比与维度精度取舍,可据此评估代码 RAG 的存储成本。
Mistral 发布 Agents API,将自家语言模型与代码执行、网页搜索、图像生成、MCP 工具等内置连接器结合,并提供跨对话的持久记忆和智能体编排能力。
推荐理由:官方给出 Agents API 的连接器、记忆与多智能体编排能力,读者可据此判断企业级智能体平台的搭建方式。
Mistral 提出用 LLM as a Judge 评估 RAG 系统,由 judge LLM 按数值、二元或定性量表为 generator LLM 的回答打分,再对评测数据集求加权平均。
Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序交错提取文本与图像,并已作为 Le Chat 文档理解的默认模型。
推荐理由:官方给出 Mistral OCR 的定价、基准对比与自托管选项,可据此判断它在文档解析与 RAG 流程中的位置。
Hugging Face 推出多语言视觉文档检索嵌入模型 vdr-2b-multi-v1,可直接编码文档页面截图为稠密单向量,无需 OCR、数据抽取或分块。
Answer.AI 与 LightOn 联合发布 ModernBERT,这是一系列编码器模型,作为 BERT 类模型的直接替换方案,提供 base(149M 参数)和 large(395M 参数)两个版本。
推荐理由:ModernBERT 把近年 LLM 的架构与训练经验移植回编码器,读者可据此判断 BERT 类模型在检索与分类场景的替换空间。
Digital Green 在 CGIAR 主导的 GAIA 项目中开发了农业问答机器人 Farmer.chat,并联合 Hugging Face 专家搭建 LLM-as-a-Judge 评估体系来评测其 RAG 管线。
HuggingChat 发布 Community Tools,用户可以把 Hugging Face 上任意公开 Space 变成模型可直接调用的工具,并借此扩展了图像理解、视频生成和文本转语音等多模态能力。
Hugging Face 博客盘点了 Hub 上 5 个常被忽视的工具:ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas。
这篇教程演示如何用 distilabel 为 Argilla 2.0 构建能理解技术文档的聊天机器人:先从 GitHub 文档切分约 256 token 的 chunk 并生成合成数据集,再微调领域专用嵌入模型、搭建向量数据库,最后将 Gradio 应用部署到 Hugging Face Space,并把对话存入 Argilla 持续评估改进。
Banque des Territoires(CDC 集团)、Polyconseil 与 Hugging Face 合作,为法国校园生态改造项目 EduRénov 打造基于 RAG 的主权数据方案,首阶段已完成。该方案用于优化 BdT 对地方政府的支持流程,目标覆盖 10,000 个学校设施改造项目、5 年内实现 40% 节能,CDC 为此投入 20 亿欧元贷款和 5000 万欧元前期工程资金。
XLSCOUT 发布专有嵌入模型 ParaEmbed 2.0,基于高质量多领域专利数据微调,准确率较 2023 年 10 月发布的 ParaEmbed 1.0 提升 23%。
Hugging Face Embedding Container for Amazon SageMaker 正式 GA,AWS 用户可在 SageMaker 上部署嵌入模型构建 RAG 等生成式 AI 应用。
Hugging Face 与 LangChain 联合发布合作包 langchain_huggingface,可通过 pip install langchain-huggingface 安装,将 Hugging Face 最新能力同步进 LangChain 生态。
Intel 展示了基于 OPEA 平台、用 Intel Gaudi 2 加速器和 Xeon CPU 构建企业级 RAG 应用的方案,嵌入模型跑在 Granite Rapids CPU 上,LLM 跑在 Gaudi 2 上。