跳到正文

#部署/工程

今日 9 条
今天10月3日周六
  1. AWS Machine Learning Blog28

    如何在 AWS 上为 Claude Platform 配置多环境访问

    针对 Claude Platform on AWS(CPonAWS),可通过专用 AI Services 账户实现三种推理访问方式:AWS 工作负载账户经跨账户 SigV4 调用、开发者笔记本使用工作区级 API key、外部环境经 OIDC 联邦获取短期凭证。该方案采用付款账户、AI Services 账户与工作负载账户的三账户结构,生产与开发流量通过独立工作区分隔,全程无需存储或轮换长期密钥。

  2. BestBlogs.dev71

    美光电话会:2027 年超 75% 产能已售出,看不到供需平衡拐点

    美光 2026 财年第四财季营收 542 亿美元、毛利率 87%,全年营收 1332 亿美元为上一财年的 3.5 倍,数据中心收入翻四倍。电话会上管理层称已签署 26 份战略客户协议,剩余履约义务约 1500 亿美元,2027 年超 75% 产出已获客户承诺,多数谈判转向 2028 年,并预计 2027、2028 财年存储供需比 2026 年更紧张。

  3. TechCrunch · AI62

    Shopify 推出 Canvas,通过对话让 AI 搭建网店

    Shopify 发布建站工具 Canvas,商家通过与 AI 智能体 Sidekick 对话即可搭建店铺,Canvas 实时渲染店铺真实代码而非静态预览,可测试交互与动画并查看不同屏幕尺寸下的效果。为此 Shopify 让 Sidekick 直接操作主题文件,并简化了主题架构。该产品尚处早期,暂不支持第三方主题、应用区块与扩展、多市场、翻译、灰度发布和主题更新,且仅限桌面端。

  4. TechCrunch · AI56

    AWS 发布开源决策模型 Strands Decider 2B

    AWS 发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,可在本地运行,用于在预设选项中做选择并给出置信度。该模型由 AWS 杰出工程师 Marc Brooker 在看过 TypeSafe 的 Jev 后自行开发,曾在同规模模型的 Jevbench 排名上短暂登顶,随后由 Strands Labs 整理发布。

10月2日周五
  1. Google Research62

    Google 发布基于 TEE 的联邦学习系统,为联邦数据提供可验证隐私保障

    Google 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供完全可验证、可审计的保障,Gboard 已采用该系统并受益于显著更快的计算速度。系统通过访问策略发布至公开透明日志 Rekor、KMS 密钥管理与可复现构建,让外部审计者能核查服务端运行的代码。Gboard 已用该系统上线英语和日语下一词预测模型,隐私保障更强且准确率提升,训练瓶颈从设备端转移到服务端。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,读者可了解其隐私验证机制与 Gboard 落地效果。

  2. NVIDIA Blog62

    NVIDIA 推出 DGX Spark 64GB 版本,双机可集群扩展至 128GB 内存

    NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 DGX Spark 64GB 统一内存版本,10 月 23 日开售,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。

    推荐理由:原文给出 64GB 版本的售价、上市时间与双机集群的实测加速比,可据此判断本地跑大模型的成本与扩展方式。

  3. The Verge · AI34

    微软用"仿生学"改造数据中心:在树林里伪装,就能让邻居不讨厌吗?

    微软宣布将"仿生学"(biomimicry)设计推广到美国与德国 20 多个数据中心站点,通过增加花园、本地树木和生态修复,把设施"融入自然景观"。微软称自 2022 年起已在荷兰一处数据中心试点该方案,并承诺在美国所有新项目中采用。此举正值美国多地社区抗议数据中心带来的噪音、污染、砍树和水电账单上涨,微软 2022 年曾在圣安东尼奥为建数据中心砍伐逾 2600 棵树。

  4. Hugging Face Blog32

    Hugging Face 发布 AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建的 AutoSynthData 利用目标模型的失败案例与更强教师的成功轨迹,定位能力缺口并生成、验证新的可执行任务用于后训练,课程随模型改进转向其仍难完成的任务。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成任务需满足可行性、真实性与难度三项属性,验证器则要求一致性、可靠性与完备性。

  5. NVIDIA Blog80

    NVIDIA GPU 如何加速 OpenAI GPT-6 Astra Ultrafast

    GPT-6 Astra Ultrafast 已在 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户中上线,运行在 NVIDIA Blackwell GPU 上,token 生成速度最高可达 Astra Standard 模式的 8 倍。

    推荐理由:OpenAI 与 NVIDIA 联合说明 GPT-6 Astra Ultrafast 的推理加速方式,读者可了解其速度提升与适用场景。

  6. AWS Machine Learning Blog30

    Amazon Payments 如何用 Amazon SageMaker AI 上的上下文多臂老虎机提升获客漏斗转化率

    Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)优化产品获客漏斗,七周线上 A/B 测试中,一个人群的最终漏斗转化率取得高个位数相对提升,另一个人群则未见改善。团队按申请开始、提交、审批三个阶段各跑一个 LinUCB 模型并线性组合其 UCB 分数,以缓解单阶段优化带来的跷跷板问题,同时开源了可在合成数据上验证该方法的代码仓库。

10月1日周四
  1. NVIDIA Blog22

    NVIDIA AI 工厂如何实现高投资回报:高产出、长寿命、通用性

    NVIDIA 提出 AI 工厂投资回报取决于三个因素:每兆瓦产出能力、硬件使用寿命和 token 需求,其平台以高吞吐、长服役周期和通用性同时优化这三项。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百万 token 成本最多低 45 倍。

9月30日周三
  1. AWS Machine Learning Blog62

    在 Amazon Bedrock AgentCore Runtime Instances 上构建多智能体音乐制作流水线

    AWS 官方博客介绍如何在 Amazon Bedrock AgentCore Runtime Instances 上部署三智能体音乐制作流水线,由作曲、交付、合规三个智能体在同一 GPU 实例的共享会话中协作产出可播放的 .wav。

    推荐理由:原文给出可复现的三智能体音乐制作流水线代码与实测耗时,读者可据此迁移到其他长时 GPU 工作流。

  2. NVIDIA Blog60

    NVIDIA 与 CoreWeave 将 Vera Rubin NVL72 投入生产,Cognition 为首家客户

    CoreWeave 宣布在 CoreWeave Cloud 上提供 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网网络,成为首批交付该平台的云厂商之一,Cognition 是首个在生产环境运行 Vera Rubin 的客户。

    推荐理由:CoreWeave 上线 Vera Rubin NVL72 并公布 Devin 实测吞吐数据,可据此判断智能体编码的算力成本走向。

  3. AWS Machine Learning Blog62

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的一次重大升级,面向智能体编码、计算机使用和专业工作负载提供更强的推理能力。

    推荐理由:官方给出 GPT-6.1 Sol 在 Bedrock 上的可用入口与成本对比,读者可据此判断智能体编码任务的性价比。

9月29日周二
  1. MIT Technology Review · AI12

    HPE:如何让 AI 从费用变成资产

    HPE 提出企业 AI 支出正从按 token 计费的消费模式转向自建容量的资本决策,关键在于找到自身工作负载的"交叉点"——持续用量足以摊薄固定成本时,拥有算力才比逐次购买更经济。文章建议领导者先问三个问题:需求是否稳定可预测、何种用量下自建更划算、能否通过采用与治理让容量保持高产。

9月28日周一
9月24日周四
  1. GitHub Blog · AI & ML22

    GitHub Copilot 应用如何渲染超大 pull request

    GitHub Copilot 应用重建了 pull request 视图,以应对超大 diff 与评论带来的渲染压力,并用一个含 2,200 个文件、超 100 万行改动、400 多条行内评论的开源 pull request 做了验证。其做法是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确计算,评论高度则按块惰性测量并锚定到文件、行与侧,避免滚动跳变。