OpenAI 用基于规则的奖励(RBRs)提升模型安全行为
OpenAI 开发并应用了一种基于规则的奖励(RBRs)新方法,让模型在无需大量人工数据采集的情况下学会安全行为并对齐。该方法旨在改善模型的安全行为表现。
OpenAI 开发并应用了一种基于规则的奖励(RBRs)新方法,让模型在无需大量人工数据采集的情况下学会安全行为并对齐。该方法旨在改善模型的安全行为表现。
Meta 发布 Llama 3.1,包含 8B、70B、405B 三个尺寸的 base 与 instruct 版本共六个开放权重模型,全部支持 128K token 上下文和 8 种语言,并新增 Llama Guard 3 与 Prompt Guard 两个安全模型。
推荐理由:Hugging Face 官方梳理了 Llama 3.1 三个尺寸的显存需求、量化方案与工具调用格式,可作为部署选型的参考。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用不到 4GB 内存完成 7B 参数模型的推理。
推荐理由:Hugging Face 官方给出把 Mistral 7B 转成 Core ML 并跑在 Mac 上的完整步骤,可据此复现端侧部署流程。
OpenAI 发布 GPT-4o mini,从标题看定位为更具成本效率的智能模型。材料仅提供标题,具体能力、价格与开放方式未给出。
Mistral AI 与 NVIDIA 合作发布 12B 模型 Mistral NeMo,支持最高 128k token 上下文窗口,并以 Apache 2.0 许可开放预训练基座和指令微调 checkpoint。
推荐理由:Mistral 与 NVIDIA 联合发布的 12B 模型,给出 128k 上下文、Apache 2.0 权重和 FP8 推理等关键规格,便于评估其替换 Mistral 7B 的可行性。
Hugging Face 发布 Docmatix 文档视觉问答(DocVQA)数据集,包含 240 万张图像和 950 万对 Q/A,规模是此前数据集的 240 倍。
Hugging Face 为 TGI 推出 Multi-LoRA 服务功能,只需部署一次基础模型,即可根据请求中的 adapter_id 动态加载多个 LoRA 适配器,官方称可服务 30 个模型。
推荐理由:TGI 新增 Multi-LoRA 服务能力,给出部署命令与成本对比,可据此评估多微调模型的合并部署方案。
OpenAI 为 ChatGPT Enterprise 新增 Compliance API 集成、SCIM 和 GPT 控制功能,用于支持大规模合规项目、数据安全和用户访问管理。
OpenAI 提出用证明者-验证者博弈提升语言模型输出的可读性,让 AI 给出的解题过程更清晰、更易被验证。该方法旨在使模型输出对人类和机器都更可信,从而增强 AI 解决方案的可核查性。
Mistral AI 发布基于 Mistral 7B 的数学推理模型 Mathstral 7B,在 MATH 上得分 56.6%、MMLU 上得分 63.47%,在同规模模型中达到 SOTA。
Mistral 发布 Codestral Mamba,这是一个基于 Mamba 架构的代码模型,采用 Apache 2.0 许可,可免费使用、修改和分发。该模型为指令模型,参数量 7,285,403,648,具备线性时间推理能力,在 256k tokens 的上下文检索测试中表现良好,官方称其代码与推理能力可对标 SOTA Transformer 模型。
推荐理由:Mamba 架构首次以代码模型形态开放权重,读者可据此了解线性时间推理在代码场景的落地方式。
这篇教程演示如何用 distilabel 为 Argilla 2.0 构建能理解技术文档的聊天机器人:先从 GitHub 文档切分约 256 token 的 chunk 并生成合成数据集,再微调领域专用嵌入模型、搭建向量数据库,最后将 Gradio 应用部署到 Hugging Face Space,并把对话存入 Argilla 持续评估改进。
Hugging Face 发布 SmolLM 系列小语言模型,包含 135M、360M 和 1.7B 三个参数规模,并同步开源训练语料 SmolLM-Corpus。
推荐理由:官方披露了 135M 到 1.7B 三档小模型的训练数据构成与同尺寸对比结果,可据此判断端侧部署的可行边界。
Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AI 数学奥林匹克(AIMO)进步奖,在私有测试集 50 题中解出 29 题。
推荐理由:获胜方案完整公开了两阶段微调、SC-TIR 解码与内部验证集设计,可迁移到其他推理类竞赛与模型训练。
OpenAI 与洛斯阿拉莫斯国家实验室达成研究合作,共同开发安全评估方法,用于评估和衡量前沿模型相关的生物能力与风险。
Hugging Face 与 KerasHub 实现共享模型保存格式,Hub 上 30 万+ Transformers 模型现可直接加载进 KerasHub,首批支持 Gemma 1/2、Llama 3 和 PaliGemma。KerasHub 模型可在 TensorFlow、JAX、PyTorch 后端间一行代码切换,需将 keras 升级至 3.3.3 以上。
Hugging Face 正在 Dataset Hub 上试验一项基于开源 PII 检测工具 Presidio 的新功能,可为数据集生成 PII 存在情况的估算报告。Presidio 依靠检测模式和机器学习模型识别 PII,报告可帮助开发者在训练前决定是否进一步过滤数据,也便于数据集所有者验证自身的 PII 过滤流程。
Hugging Face 的 TRL 库现已支持对视觉语言模型(VLM)进行直接偏好优化(DPO),并给出基于 Idefics2-8b 的完整训练教程。示例使用包含超 83,000 条标注的 openbmb/RLAIF-V-Dataset,DPO 实现同时支持 Llava 1.5 和 PaliGemma。文章还测算了 8B 模型全参数训练约需 160GB 显存,需借助量化等技术才能跑通。
Banque des Territoires(CDC 集团)、Polyconseil 与 Hugging Face 合作,为法国校园生态改造项目 EduRénov 打造基于 RAG 的主权数据方案,首阶段已完成。该方案用于优化 BdT 对地方政府的支持流程,目标覆盖 10,000 个学校设施改造项目、5 年内实现 40% 节能,CDC 为此投入 20 亿欧元贷款和 5000 万欧元前期工程资金。
Hugging Face 宣布 Google Cloud TPU v5e 正式上线 Inference Endpoints 和 Spaces,提供 v5litepod-1(1 核 16 GB,$1.375/小时)、v5litepod-4(4 核 64 GB,$5.50/小时)和 v5litepod-8(8 核 128 GB,$11.00/小时)三种配置。
Hugging Face 为 Dataset Hub 的数据集搜索新增按模态、大小、格式和库四项筛选功能,可按 Text、Image、Audio 等模态及最小/最大行数过滤,并支持 Parquet、WebDataset 等格式和 Pandas、Dask、Datasets 库兼容性筛选。这些筛选可与语言、任务、许可证等现有条件组合使用,覆盖 Hub 上超过 180,000 个公开数据集。
Intel 与 MILA 将多模态蛋白质语言模型 ProtST 重新架构并发布在 Hugging Face Hub,并基于 Optimum for Intel Gaudi 库在 Gaudi 2 上完成推理与微调。
Hugging Face 用 transformers.agents 构建的 ReactCodeAgent 在 GAIA 验证集上取得 44.2%,排名第一,比第二名高 4 个百分点;测试集为 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。
推荐理由:官方披露 Code Agent 在 GAIA 上的成绩与实现细节,可看到代码动作与多智能体编排的具体做法。
OpenAI 与 TIME 达成战略内容合作,将接入 TIME 101 年的档案内容,用于增强模型回答并提供 Time.com 报道链接。
Google 发布 Gemma 2 系列开源大模型,包含 9B 和 27B 两个尺寸,各有基础版与指令微调版共 4 个开放权重模型,上下文长度 8K token。
推荐理由:文章梳理了 Gemma 2 的滑动窗口注意力、软上限与知识蒸馏等训练改动,并给出与 Llama 3、Qwen 1.5 的基准对比。
XLSCOUT 发布专有嵌入模型 ParaEmbed 2.0,基于高质量多领域专利数据微调,准确率较 2023 年 10 月发布的 ParaEmbed 1.0 提升 23%。
微软 6 月发布的 Florence-2 视觉语言模型仅有 0.2B 和 0.7B 两种小尺寸,原生支持 captioning、目标检测、OCR 等任务,但发布的模型不含 VQA 能力。在 DocVQA 数据集上微调七个 epoch 后,验证集 Levenshtein 相似度从 0 提升至 57.0,作者建议用 The Cauldron 进一步微调以获得更强的 VQA 模型。
Hugging Face 发布《伦理与社会通讯》第6期,聚焦 AI 数据质量。文章指出高质量数据并非仅指准确或量大,而应契合具体用途,需具备相关性、全面性、时效性并减少偏见。数据质量直接影响模型性能、鲁棒性、效率与公平性,应从 AI 开发全生命周期加以重视。
OpenAI 宣布收购 Rockset。该消息由 OpenAI 官方发布,具体交易金额与整合细节尚未在现有材料中披露。
推荐理由:OpenAI 官方宣布收购 Rockset,可据此观察其在数据检索与实时分析方向的布局。
OpenAI 公布网络安全资助计划,聚焦创新研究与 AI 在网络安全领域的整合。该计划旨在赋能防御者,具体资助金额、入选项目数量及申请条件尚未披露。
OpenAI 提出一套构建稳健自然语言分类系统的整体性方法,用于真实场景下的内容审核与不良内容检测。该方法强调从整体视角应对现实世界中的内容审核需求。
Hugging Face 与 Argilla 合作的 Data Is Better Together 计划已产出 DIBT/10k_prompts_ranked 数据集,由 385 余人参与完成 1 万条合成与人工提示词的质量排序,并被用于训练 SPIN 等新模型。
OpenAI 提出改进的一致性模型(Consistency Models)训练技术。一致性模型是一类新兴生成模型,无需对抗训练即可一步采样出高质量数据。
OpenAI 提出 Consistency Models,可在不依赖迭代采样的情况下实现快速生成,从而解决扩散模型因迭代采样导致的生成速度慢问题。扩散模型已在图像、音频和视频生成领域取得显著进展,但迭代采样过程拖慢了生成速度。
视觉沟通软件公司 Prezi 加入 Hugging Face Expert Support Program,将更小、更高效的开源模型整合进其 ML 工作流。Prezi 旗舰产品 Prezi AI 结合视觉模型、文本模型和 VLM,专家建议在素材检索流程中加入开源 re-ranker 模型,以更低成本、更快速度找到最佳图文素材。
Paf 在全公司范围采用 ChatGPT Enterprise,工程师每天使用自定义 GPTs 加速日常开发任务。Paf 还将 ChatGPT Enterprise 接入 grit:lab 编程学院,让学员从第一天起就以 AI 增强的系统架构思维学习。目前 Paf 有 70% 的员工活跃使用 ChatGPT Enterprise,覆盖财务、HR、营销和客户支持等业务团队。
Hugging Face 发布 BigCodeBench,包含 1,140 个函数级任务,要求 LLM 调用 139 个库中的多个函数作为工具,每个任务平均 5.6 个测试用例、分支覆盖率 99%。
Color Health 与 OpenAI 合作推出 Cancer Copilot,利用 GPT-4o 识别缺失的诊断检查并生成个性化检查方案,帮助医疗人员就癌症筛查和治疗做出循证决策,加速患者获得治疗。
OpenAI 任命退役美国陆军上将 Paul M. Nakasone 加入董事会,他将加入董事会的安全与安保委员会。Nakasone 为持续扩大的董事会带来网络安全方面的经验。
Hugging Face Accelerate 在 0.30.0 版本中为 FSDP 加入自动 upcasting,使其在混合精度下与 DeepSpeed 行为对齐。