GPT-6.1 Sol 在 Amazon Bedrock 正式可用
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的一次重大升级,面向智能体编码、计算机使用和专业工作负载提供更强的推理能力。
推荐理由:官方给出 GPT-6.1 Sol 在 Bedrock 上的可用入口与成本对比,读者可据此判断智能体编码任务的性价比。
微软的 AI 布局:Copilot 全家桶、Azure AI 基础设施与 OpenAI 合作关系的持续追踪。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的一次重大升级,面向智能体编码、计算机使用和专业工作负载提供更强的推理能力。
推荐理由:官方给出 GPT-6.1 Sol 在 Bedrock 上的可用入口与成本对比,读者可据此判断智能体编码任务的性价比。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物世界模型和连接模型、科学工具、文献与实验人员的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并排序数千种化合物以推动肿瘤细胞状态转变,最高排名化合物在湿实验中产生了最大的预期转变,整个筛选到候选验证过程仅用一个周末。
推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。
微软研究院发布针对物理 AI 机器人推理基础设施的系统性研究,指出把推理全部放在机载 GPU 上会限制机器人性能、续航与扩展性,卸载到边缘或云端 GPU 则有明显收益。
推荐理由:微软对机器人推理负载的系统性测量显示,把推理从机载 GPU 卸载到边缘或云端可同时改善任务成功率与续航。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产 Rust,代码主要由 AI 智能体编写,分布在 128 个合入 main 的 PR 中并逐步发布。
推荐理由:作者以亲历者身份给出把 80 万行运行时迁到 Rust 的完整数据,可看到智能体协作与人工把关的实际分工。
GitHub 发布研究预览 Project HydraFusion,在 GitHub Copilot CLI 中通过运行时编排多个提供商的模型,自动选择 Single、Cascade、Critique 三种执行模式来平衡质量、成本与延迟。
推荐理由:GitHub 官方给出 HydraFusion 的三种编排模式与三个基准上的质量成本对照,可据此判断多模型编排在编码任务中的取舍。
微软研究院发布开源框架 Orchard,核心是 Orchard Env 这一可复用的 Kubernetes 环境服务,支持软件工程、网页导航和个人助理等任务,并可直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练智能体。
推荐理由:微软研究院开源 Orchard 框架,公开环境服务、训练流程与数据,读者可据此了解小模型在真实 harness 中训练智能体的做法。