跳到正文

全部动态

今日 0 条
6月12日周三
6月10日周一
6月8日周六
6月7日周五
  1. Hugging Face Blog18

    Hugging Face 将重新设计 Transformers 文档

    Hugging Face 宣布重新设计 Transformers 文档,原因是现有文档内容零散、导航困难且过时。新版将面向构建 AI 产品的开发者,采用代码优先、解决方案导向的写法,并放弃 Diátaxis 的刚性结构,改为随内容自然生长的有机结构,让新增内容与原有文档融合而非层层叠加。

6月6日周四
6月5日周三
  1. Mistral AI62

    Mistral 在 la Plateforme 推出模型定制与微调服务

    Mistral AI 在 la Plateforme 上线模型定制功能,提供三种微调入口:面向自建基础设施的开源微调代码库 mistral-finetune、平台上的无服务器微调服务,以及面向特定客户的定制训练服务。

    推荐理由:Mistral 给出微调的三条落地路径与 LoRA 效率对比,读者可据此判断自建还是托管微调更合适。

6月4日周二
5月31日周五
  1. Hugging Face Blog62

    Hugging Face 披露 Spaces secrets 遭未授权访问并更新安全措施

    Hugging Face 本周检测到 Spaces 平台遭未授权访问,涉及 Spaces secrets,怀疑部分 secrets 可能被未授权读取。作为处置,官方已撤销这些 secrets 中的部分 HF token 并邮件通知相关用户,建议用户刷新密钥或 token 并改用细粒度访问 token。

    推荐理由:官方披露 Spaces secrets 遭未授权访问及已采取的处置措施,可了解平台安全策略的调整方向。

5月30日周四
5月29日周三
  1. Mistral AI62

    Mistral AI 发布非生产许可 MNPL,Codestral 率先采用

    Mistral AI 推出非生产许可 MNPL,允许开发者将技术用于非商业用途并支持研究工作,要求基于其成果开展商业业务的一方以公平可持续的方式合作。Codestral 于同日在该许可下发布。Mistral 表示将继续以 Apache 2.0 发布模型和代码,并逐步整合 Apache 2.0 与 MNPL 两条产品线。

    推荐理由:Mistral 推出 MNPL 非生产许可,读者可了解其如何在开放原则与商业可持续之间划界。

5月28日周二
5月24日周五
  1. Hugging Face Blog45

    Meta 发布 CyberSecEval 2:大语言模型网络安全风险与能力评估框架

    Meta 发布 CyberSecEval 2,用于评估 LLM 在生成不安全代码、协助网络攻击、提示注入、滥用代码解释器及自动化攻击能力等方面的表现。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率从 52% 降至 28%。提示注入仍是未解决问题,代码解释器滥用风险突出,全部代码已开源。

  2. Hugging Face Blog62

    TII 发布 Falcon 2:11B 参数预训练语言模型与 VLM,训练数据超 5000B tokens、支持 11 种语言

    TII 发布 Falcon 2 系列,包含 11B 基础语言模型和具备图像理解能力的 11B VLM,训练数据超过 5000B tokens,主要支持英语并覆盖西班牙语、法语、德语等另外十种语言。

    推荐理由:TII 官方给出 Falcon 2 的训练数据、架构与评测对比,可据此判断 11B 小模型在多语言和视觉理解上的位置。

5月22日周三
5月21日周二
5月20日周一
5月16日周四
  1. OpenAI News20

    Canva 打造 AI 驱动的 Magic Studio

    Canva 推出 AI 驱动的 Magic Studio,为其月活超 1.75 亿的视觉传播平台加入 AI 创作能力。该平台支持制作演示文稿、视频、文档、网站和社交媒体图片,面向缺乏设计训练的知识工作者,通过易用界面、庞大素材库和提效工具降低创作门槛。

5月15日周三
5月14日周二
  1. Hugging Face Blog62

    Google 发布开源视觉语言模型 PaliGemma

    Google 发布视觉语言模型系列 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像与文本并输出文本。

    推荐理由:Google 开源视觉语言模型 PaliGemma 的架构、三种权重类型与微调路径都在文中给出,可据此判断它适合哪些下游任务。