跳到正文

全部动态

今日 4 条
3月7日周五
  1. Mistral AI77

    Mistral AI 发布文档理解 API Mistral OCR

    Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序交错提取文本与图像,并已作为 Le Chat 文档理解的默认模型。

    推荐理由:官方给出 Mistral OCR 的定价、基准对比与自托管选项,可据此判断它在文档解析与 RAG 流程中的位置。

3月6日周四
3月4日周二
2月28日周五
2月27日周四
  1. OpenAI News67

    OpenAI 发布 GPT-4.5 系统卡

    OpenAI 发布 GPT-4.5 系统卡,并以研究预览形式推出 GPT-4.5,称其是目前规模最大、知识最广的模型。

    推荐理由:OpenAI 公布 GPT-4.5 系统卡,说明这是其目前规模最大、知识最广的模型,并以研究预览形式发布。

2月25日周二
  1. OpenAI News62

    OpenAI 发布 deep research 系统卡

    OpenAI 发布 deep research 系统卡,说明该功能发布前开展的安全工作,包括外部红队测试、依据 Preparedness Framework 进行的前沿风险评估,以及针对关键风险领域构建的缓解措施概览。

    推荐理由:OpenAI 公开 deep research 发布前的安全评估流程,可了解外部红队与 Preparedness Framework 如何落地。

  2. Hugging Face Blog62

    Hugging Face 发布 FastRTC:面向 Python 的实时通信库

    Hugging Face 发布 FastRTC,一个用 Python 构建实时音频和视频 AI 应用的实时通信库。它内置自动语音检测与轮次切换、WebRTC 版 Gradio UI、WebSocket 支持,并可通过 fastphone() 获取免费电话号码接入音频流。库还提供语音转文字、文字转语音和停用词检测等工具,可挂载到任意 FastAPI 应用部署。

    推荐理由:FastRTC 把 WebRTC 实时音视频通信封装成 Python 库,读者可据此判断实时语音应用的搭建门槛变化。

2月24日周一
2月21日周五
2月20日周四
2月19日周三
  1. Hugging Face Blog40

    Google 发布 PaliGemma 2 Mix 指令视觉语言模型

    Google 发布 PaliGemma 2 Mix,这是基于 SigLIP 和 Gemma 2 的 PaliGemma 2 视觉语言模型系列的微调版本,覆盖 OCR、长短图像描述、视觉问答、目标检测与图像分割等任务。模型提供 3B、10B、28B 三种参数规模和 224、448、896 三种分辨率,支持 HF Transformers 与 JAX 框架,并已上线演示。

2月18日周二
  1. OpenAI News36

    OpenAI 发布 SWE-Lancer 基准

    OpenAI 发布 SWE-Lancer 基准,用于测试前沿 LLM 能否完成真实自由职业软件工程任务并赚取 100 万美元。该基准以真实外包项目为题目来源,衡量模型在实际软件工程工作中的变现能力。

2月17日周一
  1. Mistral AI60

    Mistral 发布区域语言模型 Mistral Saba

    Mistral AI 发布 Mistral Saba,这是其首个专门面向区域语言的模型,参数规模 24B,训练数据来自中东和南亚。该模型支持阿拉伯语和多种印度源语言,在泰米尔语等南印度语言上表现突出,官方称其回答比规模大 5 倍以上的模型更准确,同时速度更快、成本更低。

    推荐理由:Mistral 推出面向中东和南亚的区域语言模型,读者可了解其参数规模、语言覆盖与本地部署方式。

2月14日周五
  1. Hugging Face Blog62

    Hugging Face 用 Math-Verify 重评 Open LLM Leaderboard 全部 3751 个模型

    Hugging Face 用 Math-Verify 重新评测了 Open LLM Leaderboard 上提交过的全部 3751 个模型,替换掉此前无法正确解析答案格式、SymPy 表达式和等价比较的旧评测器。

    推荐理由:官方复盘了旧数学评测的解析缺陷,并给出重评后榜单变化,可据此理解基准分数差异的来源。

2月13日周四
2月12日周三
2月11日周二
  1. Hugging Face Blog62

    Open R1 发布 OpenR1-Math-220k 数学推理数据集

    Hugging Face 的 Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,用 DeepSeek R1 为 NuminaMath 1.5 的 40 万道题各生成两个答案,共 80 万条推理轨迹,经 Math Verify 与 Llama3.3-70B-Instruct 过滤后保留 22 万道题。

    推荐理由:Open R1 项目公开了 220k 数学推理数据集的生成与过滤流程,读者可参考其本地推理与验证方法。

2月10日周一
  1. Hugging Face Blog31

    Hugging Face 发布 Open Arabic LLM Leaderboard 2

    Hugging Face 联合 2A2I、TII 推出 Open Arabic LLM Leaderboard 2,升级阿拉伯语大模型评测平台。初版 OALL 上线不到 7 个月吸引超 46,000 名访客,收到 180 多个机构提交的 700 多个模型,参数规模从 1B 到 70B 以上。新版回应社区对阿拉伯语专项任务直接评测、基准透明度和方言多样性数据集的诉求。

2月7日周五
2月6日周四
2月4日周二
  1. OpenAI News62

    OpenAI 与加州州立大学系统合作,向 50 万师生提供 ChatGPT

    OpenAI 宣布与加州州立大学(CSU)系统合作,将 ChatGPT 带给 50 万名学生和教职员工,官方称这是迄今规模最大的一次 ChatGPT 部署。该合作旨在扩大 AI 在教育中的使用,并帮助美国培养具备 AI 能力的劳动力。

    推荐理由:OpenAI 与加州州立大学系统合作,把 ChatGPT 覆盖到 50 万师生,是观察 AI 进校园规模的一个样本。