uniopen 如何用 Amazon Nova 2 Lite 定制零售审核策略并部署到生产
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并做提示词层面的输出优化,使其适配自身零售审核策略。
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并做提示词层面的输出优化,使其适配自身零售审核策略。
针对 Claude Platform on AWS(CPonAWS),可通过专用 AI Services 账户实现三种推理访问方式:AWS 工作负载账户经跨账户 SigV4 调用、开发者笔记本使用工作区级 API key、外部环境经 OIDC 联邦获取短期凭证。该方案采用付款账户、AI Services 账户与工作负载账户的三账户结构,生产与开发流量通过独立工作区分隔,全程无需存储或轮换长期密钥。
OpenAI 发布 GPT-6 家族模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备 workflows。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言转为固定类型操作并复述结果。
AWS 介绍如何通过 Amazon Bedrock AgentCore Gateway 为 Claude Desktop 接入 Web Search,弥补模型训练知识截止后的信息缺口。
在 Amazon SageMaker AI 上可用多轮强化学习(MTRL)微调搜索智能体,训练 Qwen3.6-27B 在 BM25 与向量检索工具间自主决策。MTRL 支持 PPO、CISPO、IS 损失与 GRPO 等优势估计器,采用无服务器按 token 计费,并可在 MLflow 中逐轮观测轨迹与奖励。
Google 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供完全可验证、可审计的保障,Gboard 已采用该系统并受益于显著更快的计算速度。系统通过访问策略发布至公开透明日志 Rekor、KMS 密钥管理与可复现构建,让外部审计者能核查服务端运行的代码。Gboard 已用该系统上线英语和日语下一词预测模型,隐私保障更强且准确率提升,训练瓶颈从设备端转移到服务端。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,读者可了解其隐私验证机制与 Gboard 落地效果。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 DGX Spark 64GB 统一内存版本,10 月 23 日开售,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。
推荐理由:原文给出 64GB 版本的售价、上市时间与双机集群的实测加速比,可据此判断本地跑大模型的成本与扩展方式。
ServiceNow CoreAI 构建的 AutoSynthData 利用目标模型的失败案例与更强教师的成功轨迹,定位能力缺口并生成、验证新的可执行任务用于后训练,课程随模型改进转向其仍难完成的任务。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成任务需满足可行性、真实性与难度三项属性,验证器则要求一致性、可靠性与完备性。
GPT-6 Astra Ultrafast 已在 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户中上线,运行在 NVIDIA Blackwell GPU 上,token 生成速度最高可达 Astra Standard 模式的 8 倍。
推荐理由:OpenAI 与 NVIDIA 联合说明 GPT-6 Astra Ultrafast 的推理加速方式,读者可了解其速度提升与适用场景。
AWS Professional Services 用四个智能体(Intake、IaC、Migration Intelligence and Governance、SRE)在 Amazon Bedrock AgentCore 上构建云迁移方案,将每个应用的 IaC 开发时间从 3 到 4 周缩短至分钟级,该数据来自内部项目跟踪。
Amazon Quick 为 AI 构建的 Quick Apps 推出 Live Data in Apps,发布后的应用每次打开都会实时查询受治理的 Quick Sight 数据集,而非使用构建时的静态快照,查询以查看者身份执行,自动沿用现有行级与列级安全规则。
NVIDIA NeMo Agent Toolkit(NAT)可通过自定义 memory provider 接入 Amazon S3 Vectors,作为多智能体系统的持久化记忆层,并部署在 Amazon EKS 上。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)优化产品获客漏斗,七周线上 A/B 测试中,一个人群的最终漏斗转化率取得高个位数相对提升,另一个人群则未见改善。团队按申请开始、提交、审批三个阶段各跑一个 LinUCB 模型并线性组合其 UCB 分数,以缓解单阶段优化带来的跷跷板问题,同时开源了可在合成数据上验证该方法的代码仓库。
Amazon Bedrock AgentCore 支持构建响应事件流的环境智能体(ambient agent),文件落入 Amazon S3 后数秒内即可生成并运行任务,智能体分析文件、呈现结果,并在下一步前请求人工批准。
NVIDIA 提出 AI 工厂投资回报取决于三个因素:每兆瓦产出能力、硬件使用寿命和 token 需求,其平台以高吞吐、长服役周期和通用性同时优化这三项。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百万 token 成本最多低 45 倍。
微软研究院实习生开发了一套端到端机器学习流水线,结合太阳风观测、AE 与 Dst 指数预报、地质电导率和电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
Amazon Bedrock Knowledge Bases 可通过 AgenticRetrieveStream API 用自然语言查询理赔文档,支持多轮追问、按 claim ID 和 claim type 等元数据过滤检索,并返回带引用的答案。
AWS 官方博客介绍如何在 Amazon Bedrock AgentCore Runtime Instances 上部署三智能体音乐制作流水线,由作曲、交付、合规三个智能体在同一 GPU 实例的共享会话中协作产出可播放的 .wav。
推荐理由:原文给出可复现的三智能体音乐制作流水线代码与实测耗时,读者可据此迁移到其他长时 GPU 工作流。
CoreWeave 宣布在 CoreWeave Cloud 上提供 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网网络,成为首批交付该平台的云厂商之一,Cognition 是首个在生产环境运行 Vera Rubin 的客户。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 并公布 Devin 实测吞吐数据,可据此判断智能体编码的算力成本走向。
Amazon Bedrock 现支持 Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5 在印度境内推理,请求仅在 ap-south-1 与 ap-south-2 之间路由,数据不存储在目标区域。
Amazon Bedrock 现已在首尔和新加坡支持 Anthropic Claude 模型的区域内推理,首尔支持 Claude Opus 5 和 Claude Sonnet 5,新加坡支持 Claude Sonnet 5,通过 bedrock-runtime 端点调用。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的一次重大升级,面向智能体编码、计算机使用和专业工作负载提供更强的推理能力。
推荐理由:官方给出 GPT-6.1 Sol 在 Bedrock 上的可用入口与成本对比,读者可据此判断智能体编码任务的性价比。
基于 Amazon Quick 与 Amazon Bedrock AgentCore 的合同智能平台,用 AI 智能体从合同 PDF 中抽取 8 个关键字段并附置信度,再由 Claude Haiku 验证智能体独立复核,签名识别分歧时由 Amazon Textract 用计算机视觉做确定性裁决。
Condé Nast 与 AWS 生成式 AI 创新中心合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,采用 TwelveLabs Marengo 嵌入模型联合编码画面、音频与转录文本,将单次内容检索耗时从 250 分钟降至 2 分钟以内。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心将与 BMW 合作碰撞仿真、与 Siemens Energy 合作工业 AI 应用,并与慕尼黑工业大学(TUM)合作利用风洞设施开发汽车空气动力学数字孪生。
Remedy Entertainment 的 CONTROL Resonant 已在 GeForce NOW 首发上线,Ultimate 会员可以 GeForce RTX 5080 级性能串流,支持 DLSS 4、光线追踪、Reflex 和最高 5K HDR,无需 100GB 本地安装。
GitHub Copilot 应用重建了 pull request 视图,以应对超大 diff 与评论带来的渲染压力,并用一个含 2,200 个文件、超 100 万行改动、400 多条行内评论的开源 pull request 做了验证。其做法是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确计算,评论高度则按块惰性测量并锚定到文件、行与侧,避免滚动跳变。
微软研究院发布针对物理 AI 机器人推理基础设施的系统性研究,指出把推理全部放在机载 GPU 上会限制机器人性能、续航与扩展性,卸载到边缘或云端 GPU 则有明显收益。
推荐理由:微软对机器人推理负载的系统性测量显示,把推理从机载 GPU 卸载到边缘或云端可同时改善任务成功率与续航。
Google DeepMind 公布 Private AI Compute 的新技术能力,将持久化服务端记忆引入该平台,使 AI 助手能在多设备间保留上下文,同时维持接近端侧的隐私标准。
推荐理由:Google 公开了云端持久记忆的加密与验证机制,可据此了解跨设备 AI 记忆如何兼顾隐私。
NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,新增智能体工作流与平台支持,免费开源并已在 GitHub 提供。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并列出多家厂商的落地方式,可据此判断开源机器人栈的演进方向。
Hugging Face 在 transformers 中加入 GGUF 支持,用户可从 Hub 选取量化检查点,通过 from_pretrained 传入 gguf_file 在本地生成,无需额外配置。
推荐理由:Hugging Face 官方说明 transformers 如何直接加载 GGUF 量化权重,并给出与 llama.cpp 的性能对比和当前限制。
NVIDIA 推出 DSX Ready 认证计划,用于评估合作伙伴产品是否符合 NVIDIA DSX AI 工厂参考设计要求,首批覆盖电池储能系统(BESS)和冷却分配单元(CDU)两类。
NVIDIA 发布 Halos,称其为首个也是唯一面向物理 AI 的全栈安全系统,覆盖设计、验证与部署各层。
NVIDIA 在开罗大埃及博物馆举办活动,展示埃及 AI 生态从能力建设走向规模化落地,其 Deep Learning Institute 埃及学员规模一年增长超十倍。
NVIDIA 提出 AI 安全是工程问题,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。其开源安全运行时 NVIDIA OpenShell 在智能体之外强制执行策略并提供沙箱执行,Cisco DefenseClaw 在其上增加治理层,JFrog 则集成 OpenShell 扫描并验证智能体技能。
NVIDIA 在纽约气候周上介绍了 5 家用 AI 推进清洁能源的公司:ThinkLabs AI 用数字孪生和智能体把南加州爱迪生评估每份电网并网申请的时间从 30-45 天缩短到 2 分钟。
Hugging Face 发布 tokenizers v1,输出与 v0.23 完全一致的 token ID,速度常达 v0.23 的数十倍。
Pawprint Studio 的开放世界捉宠 RPG《Aniimo》首发即登陆 GeForce NOW,玩家无需等待 45GB 下载即可在 Steam Deck 和新增支持的 Firefox 浏览器上串流游玩。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产 Rust,代码主要由 AI 智能体编写,分布在 128 个合入 main 的 PR 中并逐步发布。
推荐理由:作者以亲历者身份给出把 80 万行运行时迁到 Rust 的完整数据,可看到智能体协作与人工把关的实际分工。