uniopen 如何用 Amazon Nova 2 Lite 定制零售审核策略并部署到生产
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并做提示词层面的输出优化,使其适配自身零售审核策略。
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并做提示词层面的输出优化,使其适配自身零售审核策略。
针对 Claude Platform on AWS(CPonAWS),可通过专用 AI Services 账户实现三种推理访问方式:AWS 工作负载账户经跨账户 SigV4 调用、开发者笔记本使用工作区级 API key、外部环境经 OIDC 联邦获取短期凭证。该方案采用付款账户、AI Services 账户与工作负载账户的三账户结构,生产与开发流量通过独立工作区分隔,全程无需存储或轮换长期密钥。
美光 2026 财年第四财季营收 542 亿美元、毛利率 87%,全年营收 1332 亿美元为上一财年的 3.5 倍,数据中心收入翻四倍。电话会上管理层称已签署 26 份战略客户协议,剩余履约义务约 1500 亿美元,2027 年超 75% 产出已获客户承诺,多数谈判转向 2028 年,并预计 2027、2028 财年存储供需比 2026 年更紧张。
Shopify 发布建站工具 Canvas,商家通过与 AI 智能体 Sidekick 对话即可搭建店铺,Canvas 实时渲染店铺真实代码而非静态预览,可测试交互与动画并查看不同屏幕尺寸下的效果。为此 Shopify 让 Sidekick 直接操作主题文件,并简化了主题架构。该产品尚处早期,暂不支持第三方主题、应用区块与扩展、多市场、翻译、灰度发布和主题更新,且仅限桌面端。
AWS 发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,可在本地运行,用于在预设选项中做选择并给出置信度。该模型由 AWS 杰出工程师 Marc Brooker 在看过 TypeSafe 的 Jev 后自行开发,曾在同规模模型的 Jevbench 排名上短暂登顶,随后由 Strands Labs 整理发布。
Google 的轨道计算卫星原型随 SpaceX 火箭从加州升空,这是该公司首次把自研芯片送入太空,卫星由 Planet Labs 建造,将验证 TPU 能否在轨运行。
Apple 修改全盘访问权限机制,以遏制 AI 智能体滥用。Meta 认为 FDA 不足以监管 Muse 读取消息,Apple 对此持不同意见。
Cloudflare 发布 Clef 和 Clef-flash 两款面向 AI 智能体的决策模型,返回带概率的简短分类而非长文本,并称智能体决策不再必须有人参与。
OpenAI 发布 GPT-6 家族模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备 workflows。
MIT Technology Review 报告指出,2026 年全球 AI 投资将达 2.5 万亿美元,同比增长 44%,但多数企业仍未能靠 AI 实现收入增长。报告将 AI 从工具变为运营模式的转变称为“智能体转型”,主张以流程重构为先、构建可组合架构,并解决 AI 主权问题。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言转为固定类型操作并复述结果。
AWS 介绍如何通过 Amazon Bedrock AgentCore Gateway 为 Claude Desktop 接入 Web Search,弥补模型训练知识截止后的信息缺口。
在 Amazon SageMaker AI 上可用多轮强化学习(MTRL)微调搜索智能体,训练 Qwen3.6-27B 在 BM25 与向量检索工具间自主决策。MTRL 支持 PPO、CISPO、IS 损失与 GRPO 等优势估计器,采用无服务器按 token 计费,并可在 MLflow 中逐轮观测轨迹与奖励。
Google 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供完全可验证、可审计的保障,Gboard 已采用该系统并受益于显著更快的计算速度。系统通过访问策略发布至公开透明日志 Rekor、KMS 密钥管理与可复现构建,让外部审计者能核查服务端运行的代码。Gboard 已用该系统上线英语和日语下一词预测模型,隐私保障更强且准确率提升,训练瓶颈从设备端转移到服务端。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,读者可了解其隐私验证机制与 Gboard 落地效果。
Airbnb CTO Ahmad Al-Dahle 介绍了公司向 AI-native 转型的做法:目前 60% 的代码由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 DGX Spark 64GB 统一内存版本,10 月 23 日开售,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。
推荐理由:原文给出 64GB 版本的售价、上市时间与双机集群的实测加速比,可据此判断本地跑大模型的成本与扩展方式。
微软宣布将"仿生学"(biomimicry)设计推广到美国与德国 20 多个数据中心站点,通过增加花园、本地树木和生态修复,把设施"融入自然景观"。微软称自 2022 年起已在荷兰一处数据中心试点该方案,并承诺在美国所有新项目中采用。此举正值美国多地社区抗议数据中心带来的噪音、污染、砍树和水电账单上涨,微软 2022 年曾在圣安东尼奥为建数据中心砍伐逾 2600 棵树。
Earendil 发布 Pi 1.0 与 Pi Durable,两者登上 Hacker News 首页。Pi 1.0 带来 Codemode 原生支持 MCP、Jev 与图像模型,新增虚拟模型扩展、延迟工具加载、Anthropic 模型缓存预热、对话中途系统消息、新 TUI 主题并默认全屏。
ServiceNow CoreAI 构建的 AutoSynthData 利用目标模型的失败案例与更强教师的成功轨迹,定位能力缺口并生成、验证新的可执行任务用于后训练,课程随模型改进转向其仍难完成的任务。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成任务需满足可行性、真实性与难度三项属性,验证器则要求一致性、可靠性与完备性。
GPT-6 Astra Ultrafast 已在 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户中上线,运行在 NVIDIA Blackwell GPU 上,token 生成速度最高可达 Astra Standard 模式的 8 倍。
推荐理由:OpenAI 与 NVIDIA 联合说明 GPT-6 Astra Ultrafast 的推理加速方式,读者可了解其速度提升与适用场景。
AWS Professional Services 用四个智能体(Intake、IaC、Migration Intelligence and Governance、SRE)在 Amazon Bedrock AgentCore 上构建云迁移方案,将每个应用的 IaC 开发时间从 3 到 4 周缩短至分钟级,该数据来自内部项目跟踪。
Amazon Quick 为 AI 构建的 Quick Apps 推出 Live Data in Apps,发布后的应用每次打开都会实时查询受治理的 Quick Sight 数据集,而非使用构建时的静态快照,查询以查看者身份执行,自动沿用现有行级与列级安全规则。
NVIDIA NeMo Agent Toolkit(NAT)可通过自定义 memory provider 接入 Amazon S3 Vectors,作为多智能体系统的持久化记忆层,并部署在 Amazon EKS 上。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)优化产品获客漏斗,七周线上 A/B 测试中,一个人群的最终漏斗转化率取得高个位数相对提升,另一个人群则未见改善。团队按申请开始、提交、审批三个阶段各跑一个 LinUCB 模型并线性组合其 UCB 分数,以缓解单阶段优化带来的跷跷板问题,同时开源了可在合成数据上验证该方法的代码仓库。
Amazon Bedrock AgentCore 支持构建响应事件流的环境智能体(ambient agent),文件落入 Amazon S3 后数秒内即可生成并运行任务,智能体分析文件、呈现结果,并在下一步前请求人工批准。
NVIDIA 提出 AI 工厂投资回报取决于三个因素:每兆瓦产出能力、硬件使用寿命和 token 需求,其平台以高吞吐、长服役周期和通用性同时优化这三项。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百万 token 成本最多低 45 倍。
微软研究院实习生开发了一套端到端机器学习流水线,结合太阳风观测、AE 与 Dst 指数预报、地质电导率和电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
Amazon Bedrock Knowledge Bases 可通过 AgenticRetrieveStream API 用自然语言查询理赔文档,支持多轮追问、按 claim ID 和 claim type 等元数据过滤检索,并返回带引用的答案。
AWS 官方博客介绍如何在 Amazon Bedrock AgentCore Runtime Instances 上部署三智能体音乐制作流水线,由作曲、交付、合规三个智能体在同一 GPU 实例的共享会话中协作产出可播放的 .wav。
推荐理由:原文给出可复现的三智能体音乐制作流水线代码与实测耗时,读者可据此迁移到其他长时 GPU 工作流。
CoreWeave 宣布在 CoreWeave Cloud 上提供 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网网络,成为首批交付该平台的云厂商之一,Cognition 是首个在生产环境运行 Vera Rubin 的客户。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 并公布 Devin 实测吞吐数据,可据此判断智能体编码的算力成本走向。
OpenAI 在 DevDay 2026 上发布 dots 常驻智能体、GPT-6.1 Sol 模型、Ultrafast 加速模式、Decisions API、ChatGPT Spaces 与 Marketplace,并称 ChatGPT 周活达 12 亿。
推荐理由:汇总 OpenAI DevDay 2026 的发布清单与第三方评测数据,可快速了解新模型定价、智能体产品与平台变化。
Amazon Bedrock 现支持 Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5 在印度境内推理,请求仅在 ap-south-1 与 ap-south-2 之间路由,数据不存储在目标区域。
Amazon Bedrock 现已在首尔和新加坡支持 Anthropic Claude 模型的区域内推理,首尔支持 Claude Opus 5 和 Claude Sonnet 5,新加坡支持 Claude Sonnet 5,通过 bedrock-runtime 端点调用。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的一次重大升级,面向智能体编码、计算机使用和专业工作负载提供更强的推理能力。
推荐理由:官方给出 GPT-6.1 Sol 在 Bedrock 上的可用入口与成本对比,读者可据此判断智能体编码任务的性价比。
基于 Amazon Quick 与 Amazon Bedrock AgentCore 的合同智能平台,用 AI 智能体从合同 PDF 中抽取 8 个关键字段并附置信度,再由 Claude Haiku 验证智能体独立复核,签名识别分歧时由 Amazon Textract 用计算机视觉做确定性裁决。
Condé Nast 与 AWS 生成式 AI 创新中心合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,采用 TwelveLabs Marengo 嵌入模型联合编码画面、音频与转录文本,将单次内容检索耗时从 250 分钟降至 2 分钟以内。
HPE 提出企业 AI 支出正从按 token 计费的消费模式转向自建容量的资本决策,关键在于找到自身工作负载的"交叉点"——持续用量足以摊薄固定成本时,拥有算力才比逐次购买更经济。文章建议领导者先问三个问题:需求是否稳定可预测、何种用量下自建更划算、能否通过采用与治理让容量保持高产。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心将与 BMW 合作碰撞仿真、与 Siemens Energy 合作工业 AI 应用,并与慕尼黑工业大学(TUM)合作利用风洞设施开发汽车空气动力学数字孪生。
Remedy Entertainment 的 CONTROL Resonant 已在 GeForce NOW 首发上线,Ultimate 会员可以 GeForce RTX 5080 级性能串流,支持 DLSS 4、光线追踪、Reflex 和最高 5K HDR,无需 100GB 本地安装。
GitHub Copilot 应用重建了 pull request 视图,以应对超大 diff 与评论带来的渲染压力,并用一个含 2,200 个文件、超 100 万行改动、400 多条行内评论的开源 pull request 做了验证。其做法是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确计算,评论高度则按块惰性测量并锚定到文件、行与侧,避免滚动跳变。