微软发布 GigaPath-Flash 与 GigaTIME-Flash:高效病理基础模型迈向人群级发现
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干替代原模型,在 PANDA 前列腺分级和 EBRAINS 脑肿瘤分型基准上以约 50 倍更少算力达到原 GigaPath 3% 以内的性能。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干替代原模型,在 PANDA 前列腺分级和 EBRAINS 脑肿瘤分型基准上以约 50 倍更少算力达到原 GigaPath 3% 以内的性能。
Import AI 471 期关注 Hugging Face 与 OpenAI 事件中智能体展现的通信与自我牺牲能力,Dwarkesh Patel 与 Ajeya Cotra 认为该事件严重程度超出预期。五眼联盟在 Five Country Ministerial 声明中首次就前沿模型访问与国家安全风险表态。Bill Gates 则警告 AI 不会自动带来幸福,需要前所未有的全球性应对。
Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言榜单上的首个印度语言。
Google 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成数据发现、特征工程、模型训练与评估,把原本需要数周人工数据工程的建模流程压缩到数分钟。
推荐理由:原文给出 PPE 在公共卫生、粮食安全与疫情预测上的对比数字,可了解地理空间建模自动化的实际增益。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频能力。
推荐理由:官方给出场景延长、首尾帧插值与 4K 放大等具体能力与 API 入口,可据此判断生成视频工作流的可控性变化。
Google DeepMind 宣布推出全球首个针对专有前沿级 AI 模型的双盲评测,将外部评测限制在密码学环境中,避免模型提前接触题目。该试点与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下用保密基准测试 Gemini Flash Lite 模型。
Google 发布自监督基础模型 GlucoFM,采用双流设计分离缓慢血糖趋势与短期波动,在 109,066 小时无标注 CGM 数据上预训练。在四个队列、七项临床任务共 14 组评估中,其 PR-AUC 平均比最优 GluFormer 变体高 5.8 个百分点,并在餐后血糖响应预测中取得最低 MAE。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可将原始音频直接转为准确、格式化文本。据 Artificial Analysis 测量,流式场景平均 WER 为 4.0%,非流式 2.6%;相比此前的 Chirp 3,最终转写时间改善 70%。
推荐理由:官方给出流式与非流式两套 API 的 WER 数据和相对 Chirp 3 的延迟提升,便于判断语音转写能否接入现有工作流。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,支持 ColBERT 式后期交互检索,并提供完整训练方案。作者用单张 RTX 3090 训练 14.5 小时得到的 mLateOn-medical 模型,在平均 941 token 的医学检索评测上超过所有通用检索模型,截断文档最多损失 0.24 NDCG@10。
Google 发布研究原型 AgentHands(CHI 2026),可将 LLM 的高层推理映射为 XR 中与语音同步的手势,用于空间化智能体对话。系统包含环境感知、手势事件库、手势嵌入推理与本地 XR 同步执行四步,支持指示、象形与表达三类手势。在 N=12 的用户研究中,AgentHands 相较纯语音基线在空间定位等指标上显著提升。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密、decoder-only 的推理模型家族,包含 3B、8B、30B 三个规模,基于 Granite-4.1 基座后训练而来,全部采用 Apache 2.0 许可。
推荐理由:Granite 4.2 公开了从预训练到多阶段 RL 的完整构建流程,可对照其数据配比与奖励设计理解推理模型的训练取舍。
Multiverse Computing 发布论文提出 Quantization-Aware Healing(QAH),在 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 checkpoint 蒸馏。
推荐理由:论文给出压缩加量化后从原始模型蒸馏的恢复方法,并附9项基准对比,可看4-bit模型反超16-bit来源的具体条件。
Gradio 内置的 gr.Workflow 把多步 AI 流水线描述为带类型节点的图,Gradio 会提供一个拖拽画布,每个节点可运行、每个中间结果可见。同一张图同时是 REST API,每个输出按标签生成独立端点,并支持一条命令部署到 Hugging Face Spaces。
推荐理由:Gradio 把多步 AI 流水线做成可拖拽的图,并自动暴露 REST 接口,读者可据此判断现有 Python 拼接流程的改造成本。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型。合作规模达数亿欧元,Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还将在沙特面向受监管行业制定联合市场策略。
METR 研究显示 AI 对科学的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域仅小幅加速(部分领域 arXiv 投稿不到 12 个月翻倍),而 AI 研究本身的算法进展无可测量加速。多校团队提出 SPADE 自博弈框架,让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基座提升 8.1。
Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序结构化为迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理。
Google DeepMind 回顾了 15 年游戏 AI 研究历程,从 DQN 直接以原始像素学会 49 款 Atari 2600 游戏,到 AlphaGo、AlphaZero、MuZero、AlphaStar 相继攻克围棋、国际象棋与 StarCraft II。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名聚合的移动性模式(到达时间、停留时长、周边移动)与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。
Hugging Face 发布研究,用共识分歧、掩码实体检索和拼写切换三项探针量化语音识别中的基准优化现象,评测了 11 个开源 ASR 模型。
推荐理由:通过三项探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。
Papers with Code 采用混合搜索系统,用 PostgreSQL 全文检索加 pgvector 向量召回,并通过 RRF 融合两路结果。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升吞吐,GPU 上最高 3.18 倍、端侧最高 2.87 倍。
推荐理由:Liquid AI 给出三个 LFM2.5 模型的 DSpark 草稿模型与 H100、MacBook 实测吞吐数据,可据此判断投机解码在端侧与 GPU 上的实际收益。
微软研究院发布深度学习 DFT 泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。该版本已上线 CP2K,并正在集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软推出持续追踪各版本计算性能的 living benchmark。
Mistral 发布 Agentic Search,一个面向企业复杂文档的多步检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries 中。
推荐理由:原文给出多步检索循环的工具设计与两组基准数字,可对照一次性 RAG 理解检索层的变化。
IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 的智能体记忆剂量研究,在 AppWorld 的 585 个多步任务上测试八款模型,发现记忆不是开关而是需要按模型校准的剂量。
推荐理由:八模型横评给出智能体记忆的三种剂量模式,并附上 token 开销对比,可据此判断自家模型该给多少记忆。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,PyLate 与 Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也能通过同一套 API 使用。
推荐理由:Sentence Transformers v6.0 新增多向量编码器,读者可据此判断晚交互检索的接入方式与索引成本。
Hugging Face 构建了一个约束感知的 GPU 分配器,在七个基准场景中与 FIFO 调度器对比,相同硬件和负载下 GPU 利用率最高提升 33 个百分点,优先级加权产出在每个场景均有提升,最高达 105%。
Import AI 第 469 期介绍了 DiG-bench(Discovery in Games)基准,包含 70 款规则与目标均隐藏、需靠交互探索发现的游戏,其中 21 款已公开。
Google 推出 PhotoScan,一个从普通 2D 手机照片估算体脂率(BF%)、Android-to-Gynoid 脂肪比(A/G)和 Visceral-to-Subcutaneous 脂肪面积比(V/S)的深度学习框架。
Hugging Face 发布 2026 年 1 月至 8 月的开源模型生态观察报告,基于 Hub 上的下载、点赞与衍生模型数据。报告显示公开模型仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万,Spaces 从 100 万增至 144 万,但 85.6% 的模型终身下载量不足 200 次,1.5% 的仓库占据 99.2% 的下载量。
推荐理由:Hugging Face 用平台下载、点赞与衍生模型数据,给出开源模型生态在规模、许可与采用上的半年变化。
AWS 开源 SDK Strands Robots(Apache 2.0)演示了一条流式数据闭环:用 Robot("so100") 录制 LeRobotDataset 并同步到 Hugging Face Storage Buckets。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码与智能体的最强主力模型,距 Gemini 3.6 Flash 仅三周。
推荐理由:Gemini 3.7 Flash 距上一版仅三周,价格降为一半,并给出编码与文档处理等多项基准对比,可据此判断升级幅度与成本变化。
Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1,221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现论文主张,共发布 6,816 份 Trackio logbook,覆盖 2,226 篇论文,约占会议论文的三分之一。
推荐理由:Hugging Face 用 1,200 多名社区成员和编码智能体复现 ICML 2026 论文,给出了大规模论文审计的可行路径与人类角色的具体观察。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出嵌入向量,用户可通过 UI 或 API 选择区域、时段、编码器变体(Nano 128 维 1.4M 参数、Tiny 192 维 6.2M 参数、Base 768 维 89M 参数)、分辨率及影像源,输出 int8 格式的 Cloud-Optimized GeoTIFF。
微软研究院发布 MindTopo 基准,用于评测多模态大模型在连通性、封闭性、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上明显强于交互规划,且两者均远低于人类水平,失败多发生在规划阶段而非感知阶段。图像与视频生成仅在单帧内保留拓扑关系时有用,跨多步操作仍不可靠。
Google DeepMind 发布大规模多语言手语转文本模型 SL2T,可将手语直接翻译为流式文本,首个支持场景为美国手语(ASL)转英文。该模型基于超过 50 种手语、逾 10 万小时数据训练,其中约四分之一为 ASL 数据,在 FLEURS-ASL(sd-test)上取得 70 BLEURT 的零样本成绩。
推荐理由:官方披露了 SL2T 的训练规模、手语翻译难点与端侧隐私方案,可了解手语 AI 从实验室走向消费产品的路径。
Google Research 发布研究,提出知识画像框架,把事实状态分为编码失败、召回失败、直接召回、思考后召回和无编码推理五类,并构建含 2,150 条 Wikipedia 事实、每条配 10 个问题的 WikiProfile 基准。
推荐理由:Google Research 用知识画像区分编码与召回失败,指出前沿模型的事实错误更多来自知识难以取用而非未存储。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 实现实时视频临床问诊,可感知非语言线索、引导虚拟体格检查并同步完成诊断推理。
推荐理由:Google 用 300 场随机对照视频问诊给出 AMIE 视频版与真人医生同级的评测结果,可了解多智能体异步架构如何兼顾对话延迟与临床推理。
微软研究院推出 CARE-X,一个面向胸部 X 光多种临床解读任务的统一视觉语言模型,结合生成式与结构化预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。该模型支持报告生成、病灶有无与否定判断、异常定位、多标签分类及导管位置检测等任务,采用生成或双推理模式。另一项独立实验中,Qwen3-VL-4B-Instruct 搭配确定性测量工具,用于评估直接计算能否改善测量依赖型病症的表现。
Hugging Face 的 ALTK-Evolve 与 ACE 同为无需权重更新的智能体记忆方案,但前者按任务检索少量高支持度 guideline,而非每步注入完整 playbook。
Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供自定义速率限制和带 SLA 的可用性承诺。
推荐理由:Mistral 把区域推理、SLA 保障和第三方开源模型接入放进同一套基础设施,读者可据此判断企业级部署的合规与算力选项。