Photon 为移动应用办葬礼后获 450 万美元种子轮,用智能体取代 App
AI 初创公司 Photon 完成 450 万美元种子轮融资,由 Gradient 和 A* 联合领投,Vercel、HSG、Llama Ventures 等参投。
AI 初创公司 Photon 完成 450 万美元种子轮融资,由 Gradient 和 A* 联合领投,Vercel、HSG、Llama Ventures 等参投。
AWS 发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,可在本地运行,用于在预设选项中做选择并给出置信度。该模型由 AWS 杰出工程师 Marc Brooker 在看过 TypeSafe 的 Jev 后自行开发,曾在同规模模型的 Jevbench 排名上短暂登顶,随后由 Strands Labs 整理发布。
Meta 推出开源项目 Muse Gadgets,提供开源固件和 Linux SDK,让开发者用 Raspberry Pi 或 ESP32 等硬件搭建接入 Muse 智能体的设备,并给出彩色电子墨水屏、HDMI 电视棒等项目示例,还开设了 Discord 频道。
Meta 开源了相关代码,允许用户自制搭载其新 AI 智能体 Muse 的硬件设备。Meta 建议的项目包括把 Muse 装到彩色 E Ink 显示屏上显示提醒、装到 HDMI 棒上投到大屏,或装到小尺寸触屏设备上做成类似 DIY 版 Muse Charm 的装置。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 DGX Spark 64GB 统一内存版本,10 月 23 日开售,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。
推荐理由:原文给出 64GB 版本的售价、上市时间与双机集群的实测加速比,可据此判断本地跑大模型的成本与扩展方式。
MIT 研究者 Alex Zhang 在 Latent Space 播客中介绍了其 RLM(递归语言模型)工作:基于 RLM 的 harness 是首个接近解决 ARC-AGI-3 的系统,早于 OpenAI 的 Astra。他还讨论了 AI 生成 GPU 内核、harness 作为组合泛化器、Prime Agent 与持久化子智能体,以及 OpenAI 万级智能体实验、Kimi 集群等方向。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
NVIDIA 发布开源表格基础模型 Kumo Tabular,属于 NVIDIA Kumo Structured 模型集合,已在 Hugging Face 上线,可在单次前向传播中完成分类与回归预测,无需训练、调参和特征工程。
推荐理由:原文给出模型规模、训练数据来源与四个基准排名,读者可据此判断表格基础模型的准确率与效率取舍。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心将与 BMW 合作碰撞仿真、与 Siemens Energy 合作工业 AI 应用,并与慕尼黑工业大学(TUM)合作利用风洞设施开发汽车空气动力学数字孪生。
H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者已在 H Models API 上线,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。
推荐理由:Holo4 同时给出两种尺寸、多接口能力与 OSWorld 2.0 分数,可对照前沿闭源模型看成本与参数差距。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。
推荐理由:GitHub Security Lab 把模糊测试的覆盖率迭代与崩溃分诊交给 LLM 智能体,读者可了解其任务流与工具分工设计。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径,解码最高提速 3.13x(端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x。该草稿模型约 280M 参数,仅使部署模型参数量增加 8.9%,并首日支持 llama.cpp、MLX-VLM 和 SGLang。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放了 2800 多种病毒的蛋白复合物预测 3D 结构,供全球科学家免费使用。
推荐理由:NVIDIA 联合 Google DeepMind 等机构开放 2800 多种病毒的蛋白复合物结构预测,读者可了解开放科学在疫情准备中的具体做法。
NVIDIA 在新加坡 AI Day 上联合合作伙伴展示东南亚 AI 落地进展,新加坡 HTX 将研究使用 Nemotron 3 Super 与 Nemotron 3 Nano Omni 模型推进公共安全 AI。
NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,新增智能体工作流与平台支持,免费开源并已在 GitHub 提供。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并列出多家厂商的落地方式,可据此判断开源机器人栈的演进方向。
oMLX 作者兼维护者 Jun Kim 加入 Hugging Face,全职投入 MLX 社区建设。oMLX 将保持 Apache 2.0 开源,由 Jun 继续领导,从副业转为有资金支持的长期项目,目标是提升稳定性并加快开发。Hugging Face 希望 oMLX 成为新想法的试验场,并推动 transformers 模型定义更快落地为可供各引擎使用的 MLX 参考实现。
Hugging Face 在 transformers 中加入 GGUF 支持,用户可从 Hub 选取量化检查点,通过 from_pretrained 传入 gguf_file 在本地生成,无需额外配置。
推荐理由:Hugging Face 官方说明 transformers 如何直接加载 GGUF 量化权重,并给出与 llama.cpp 的性能对比和当前限制。
Mistral 宣布与 Mozilla 达成合作,Firefox 的 AI 浏览助手 Smart Window(beta)现由 Mistral 模型驱动,先面向法国和北美用户,英国和德国预计今年晚些时候跟进。Mistral 表示会针对区域语言、方言和文化语境微调模型,并称 Smart Window 的对话默认不保存在 Mozilla 服务器上,合作方同意零数据留存。
IBM 研究团队在 ALTK-Evolve 中新增一致性指南(consistency guidelines),基于 Consistency Analyzer 诊断智能体轨迹中易翻转的决策点。
推荐理由:原文给出 Mean@k 与 Pass^k 的差距数据及一致性指南的改进幅度,读者可据此判断智能体可靠性的评估方式。
Cloudera 与 Mistral 宣布合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。合作还支持企业用专有数据在受控环境中训练自有模型,覆盖 Cloudera 平台上 30 exabytes 的客户管理数据。
TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,rank-1 adapter 仅几 MB,可通过挂载到各 Job 的 Storage Bucket 传输,无需 NCCL。
Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,由三星电子领投,Scaleup Europe Fund 与 PSG Equity 联合领投。公司称这是欧洲科技企业完成的最大规模股权融资,资金将用于扩展前沿研究、算力与商业增长。Mistral 目前业务覆盖 20 个国家,服务 125 家以上全球企业,包括 Airbus、ASML 和 HSBC。
推荐理由:Mistral 完成欧洲最大股权融资,读者可了解其主权开源全栈路线与投资方结构。
Hugging Face 发布 funes,一个为 Claude Code、Codex、pi 和 Hermes 等编码智能体提供持久记忆的本地层,从本机已有会话构建索引,一条命令即可接入。
推荐理由:funes 把编码智能体的历史会话变成可检索的本地记忆,读者可据此判断跨机器、跨智能体协作的可行路径。
Hugging Face 用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型画水彩的想法,模型通过 p5.brush 写出约 150 行 JavaScript 来作画。
Hugging Face 发布 @huggingface/kernels,一个从 Hub 加载并运行优化 WebGPU kernel 的 JavaScript 库,同时上线 207 个 Apache-2.0 许可的 kernel,每个都以独立仓库形式发布,包含 manifest、正确性用例、基准用例和 WGSL 着色器模板。
Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言榜单上的首个印度语言。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密、decoder-only 的推理模型家族,包含 3B、8B、30B 三个规模,基于 Granite-4.1 基座后训练而来,全部采用 Apache 2.0 许可。
推荐理由:Granite 4.2 公开了从预训练到多阶段 RL 的完整构建流程,可对照其数据配比与奖励设计理解推理模型的训练取舍。
Gradio 内置的 gr.Workflow 把多步 AI 流水线描述为带类型节点的图,Gradio 会提供一个拖拽画布,每个节点可运行、每个中间结果可见。同一张图同时是 REST API,每个输出按标签生成独立端点,并支持一条命令部署到 Hugging Face Spaces。
推荐理由:Gradio 把多步 AI 流水线做成可拖拽的图,并自动暴露 REST 接口,读者可据此判断现有 Python 拼接流程的改造成本。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型。合作规模达数亿欧元,Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还将在沙特面向受监管行业制定联合市场策略。
Hugging Face 发布研究,用共识分歧、掩码实体检索和拼写切换三项探针量化语音识别中的基准优化现象,评测了 11 个开源 ASR 模型。
推荐理由:通过三项探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升吞吐,GPU 上最高 3.18 倍、端侧最高 2.87 倍。
推荐理由:Liquid AI 给出三个 LFM2.5 模型的 DSpark 草稿模型与 H100、MacBook 实测吞吐数据,可据此判断投机解码在端侧与 GPU 上的实际收益。
微软研究院发布深度学习 DFT 泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。该版本已上线 CP2K,并正在集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软推出持续追踪各版本计算性能的 living benchmark。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,PyLate 与 Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也能通过同一套 API 使用。
推荐理由:Sentence Transformers v6.0 新增多向量编码器,读者可据此判断晚交互检索的接入方式与索引成本。
Hugging Face 发布 2026 年 1 月至 8 月的开源模型生态观察报告,基于 Hub 上的下载、点赞与衍生模型数据。报告显示公开模型仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万,Spaces 从 100 万增至 144 万,但 85.6% 的模型终身下载量不足 200 次,1.5% 的仓库占据 99.2% 的下载量。
推荐理由:Hugging Face 用平台下载、点赞与衍生模型数据,给出开源模型生态在规模、许可与采用上的半年变化。
AWS 开源 SDK Strands Robots(Apache 2.0)演示了一条流式数据闭环:用 Robot("so100") 录制 LeRobotDataset 并同步到 Hugging Face Storage Buckets。
Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1,221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现论文主张,共发布 6,816 份 Trackio logbook,覆盖 2,226 篇论文,约占会议论文的三分之一。
推荐理由:Hugging Face 用 1,200 多名社区成员和编码智能体复现 ICML 2026 论文,给出了大规模论文审计的可行路径与人类角色的具体观察。
Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供自定义速率限制和带 SLA 的可用性承诺。
推荐理由:Mistral 把区域推理、SLA 保障和第三方开源模型接入放进同一套基础设施,读者可据此判断企业级部署的合规与算力选项。
NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据提升了多种既有语言的质量。
推荐理由:原文给出 364M 开源权重模型的多语言覆盖与 TTFA 实测数据,可据此判断自建语音链路的延迟与部署方式。
Meta 发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数的多模态模型,采用 Apache 2.0 许可,面向本地智能体场景,可用于编码、文档分析和个人助手等隐私敏感应用。
推荐理由:Meta 开源 30B 多模态模型并给出本地智能体场景的基准对比,可据此判断本地部署的可行性。
微软研究院发布开源框架 Orchard,核心是 Orchard Env 这一可复用的 Kubernetes 环境服务,支持软件工程、网页导航和个人助理等任务,并可直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练智能体。
推荐理由:微软研究院开源 Orchard 框架,公开环境服务、训练流程与数据,读者可据此了解小模型在真实 harness 中训练智能体的做法。