uniopen 如何用 Amazon Nova 2 Lite 定制零售审核策略并部署到生产
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并做提示词层面的输出优化,使其适配自身零售审核策略。
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并做提示词层面的输出优化,使其适配自身零售审核策略。
针对 Claude Platform on AWS(CPonAWS),可通过专用 AI Services 账户实现三种推理访问方式:AWS 工作负载账户经跨账户 SigV4 调用、开发者笔记本使用工作区级 API key、外部环境经 OIDC 联邦获取短期凭证。该方案采用付款账户、AI Services 账户与工作负载账户的三账户结构,生产与开发流量通过独立工作区分隔,全程无需存储或轮换长期密钥。
哈佛物理学家 Matthew Schwartz 在 Anthropic 客座文章中介绍开源工具 BootLoops,它让 Claude 完成精确科学计算。三个月内团队在 18 个领域产出 36 篇手稿、19 位合著者,Claude 用 BootLoops 计算了 30 个积分,其中 15 个为首次算出。
OpenAI 发布 GPT-6 家族模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备 workflows。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言转为固定类型操作并复述结果。
AWS 介绍如何通过 Amazon Bedrock AgentCore Gateway 为 Claude Desktop 接入 Web Search,弥补模型训练知识截止后的信息缺口。
在 Amazon SageMaker AI 上可用多轮强化学习(MTRL)微调搜索智能体,训练 Qwen3.6-27B 在 BM25 与向量检索工具间自主决策。MTRL 支持 PPO、CISPO、IS 损失与 GRPO 等优势估计器,采用无服务器按 token 计费,并可在 MLflow 中逐轮观测轨迹与奖励。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 省下的时间解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,从而发现首个模型遗漏的问题。
AWS Professional Services 用四个智能体(Intake、IaC、Migration Intelligence and Governance、SRE)在 Amazon Bedrock AgentCore 上构建云迁移方案,将每个应用的 IaC 开发时间从 3 到 4 周缩短至分钟级,该数据来自内部项目跟踪。
NVIDIA NeMo Agent Toolkit(NAT)可通过自定义 memory provider 接入 Amazon S3 Vectors,作为多智能体系统的持久化记忆层,并部署在 Amazon EKS 上。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)优化产品获客漏斗,七周线上 A/B 测试中,一个人群的最终漏斗转化率取得高个位数相对提升,另一个人群则未见改善。团队按申请开始、提交、审批三个阶段各跑一个 LinUCB 模型并线性组合其 UCB 分数,以缓解单阶段优化带来的跷跷板问题,同时开源了可在合成数据上验证该方法的代码仓库。
Amazon Bedrock AgentCore 支持构建响应事件流的环境智能体(ambient agent),文件落入 Amazon S3 后数秒内即可生成并运行任务,智能体分析文件、呈现结果,并在下一步前请求人工批准。
AccessB 线上研讨会指出,企业将大模型和 Agent 接入业务后,安全风险已从"模型回答错误"扩展到敏感数据泄露、Prompt 注入、第三方 API 风险及 Agent 工具调用越界。传统 Web 安全测试难以发现多轮交互中的行为偏移和权限访问问题,建议企业从高风险业务场景入手,对模型、数据、权限及执行链路做深度测试,逐步构建 AI 安全评测体系。
Amazon Bedrock Knowledge Bases 可通过 AgenticRetrieveStream API 用自然语言查询理赔文档,支持多轮追问、按 claim ID 和 claim type 等元数据过滤检索,并返回带引用的答案。
AWS 官方博客介绍如何在 Amazon Bedrock AgentCore Runtime Instances 上部署三智能体音乐制作流水线,由作曲、交付、合规三个智能体在同一 GPU 实例的共享会话中协作产出可播放的 .wav。
推荐理由:原文给出可复现的三智能体音乐制作流水线代码与实测耗时,读者可据此迁移到其他长时 GPU 工作流。
Amazon Quick 的提示词工程决定其 AI 功能对自然语言请求的响应质量,核心原则包括以具体细节消除歧义、提供业务上下文、用示例代替描述。文章给出通用提示词框架 CRISPE,涵盖上下文与约束、角色与职责、意图与输入、步骤与范围等要素,适用于构建自定义智能体、自动化流程和对话式数据分析。
AWS 详解 Amazon Quick 各组件的提示词工程实践:Quick Research 需明确目标、受众与范围并自行拆解子问题,还可限定 Quick Index。
基于 Amazon Quick 与 Amazon Bedrock AgentCore 的合同智能平台,用 AI 智能体从合同 PDF 中抽取 8 个关键字段并附置信度,再由 Claude Haiku 验证智能体独立复核,签名识别分歧时由 Amazon Textract 用计算机视觉做确定性裁决。
Simon Willison 用 Claude Opus 5.5 将三张 kākāpō 照片生成为 HTML5 canvas 像素动画 Kākāpō Party,画面中至少 20 只鹦鹉跳跃庆祝并触发彩带效果。他随后让本地 Claude Code 会话借助 Playwright 加载该页面并自动点击,录制出一段 15 秒视频用于 Keynote 收尾幻灯片。
GitHub Copilot 应用中的 canvas 是一种用户与智能体共享的可定制界面,可做成看板、issue 分诊板、发布清单或仪表盘,且双向同步更新。用户无需写代码,在 agent 会话中输入 /create-canvas 并用自然语言描述工作流即可生成界面,随后可继续让智能体增删列、筛选器或拉取 open PR 来调整。
GitHub Copilot 应用重建了 pull request 视图,以应对超大 diff 与评论带来的渲染压力,并用一个含 2,200 个文件、超 100 万行改动、400 多条行内评论的开源 pull request 做了验证。其做法是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确计算,评论高度则按块惰性测量并锚定到文件、行与侧,避免滚动跳变。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产 Rust,代码主要由 AI 智能体编写,分布在 128 个合入 main 的 PR 中并逐步发布。
推荐理由:作者以亲历者身份给出把 80 万行运行时迁到 Rust 的完整数据,可看到智能体协作与人工把关的实际分工。
GitHub 日本和韩国区营销负责人把活动运营流程交给 GitHub Copilot,用 GitHub Issue 表单、标签和 Actions 搭建自动化流水线,活动从单个 Issue 自动完成建站、UTM 链接生成、报名者筛选和会后清理。团队在仓库根目录放置 AGENTS.md 运行手册,Copilot 据此沿用命名规则、时区与邮件模板,流程改动以 pull request 方式评审合并。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需离开应用即可审查、运行并预览 AI 智能体生成的代码变更。
TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,rank-1 adapter 仅几 MB,可通过挂载到各 Job 的 Storage Bucket 传输,无需 NCCL。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。团队先搭建数值对齐校验框架,再用 Vibe CLI 启动上百个智能体解析调用树并生成文档,最终采用规划、编码、测试、审查加人工审核的分模块工作流。
推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 77 的完整流程,读者可参考其数值对齐与人工审核节点的做法。
一份公开教程用 TRL 的 GRPO 对 LFM2.5-350M 做约 500 样本、100 步的微调,在 IFStruct 基准上把通过率从 22.6% 提升到 29.7%。训练可在免费 Colab 或 Kaggle GPU 上完成,评测则通过 llama.cpp 在本地 MacBook 上运行,代码已开源在 GitHub。
Hugging Face 用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型画水彩的想法,模型通过 p5.brush 写出约 150 行 JavaScript 来作画。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,支持 ColBERT 式后期交互检索,并提供完整训练方案。作者用单张 RTX 3090 训练 14.5 小时得到的 mLateOn-medical 模型,在平均 941 token 的医学检索评测上超过所有通用检索模型,截断文档最多损失 0.24 NDCG@10。
Papers with Code 采用混合搜索系统,用 PostgreSQL 全文检索加 pgvector 向量召回,并通过 RRF 融合两路结果。
Hugging Face 构建了一个约束感知的 GPU 分配器,在七个基准场景中与 FIFO 调度器对比,相同硬件和负载下 GPU 利用率最高提升 33 个百分点,优先级加权产出在每个场景均有提升,最高达 105%。
AWS 开源 SDK Strands Robots(Apache 2.0)演示了一条流式数据闭环:用 Robot("so100") 录制 LeRobotDataset 并同步到 Hugging Face Storage Buckets。
在 AppWorld Test Challenge 的 417 个任务上,同一 CodeAct 智能体下 Claude Sonnet 4.6 总成本 79 美元(0.19 美元/任务),GPT-4.1 却要 155 美元(0.37 美元/任务),尽管后者 token 单价更低——缓存命中率才是关键。
Hugging Face 博客发布《Profiling in PyTorch》系列第三部分,用 NVIDIA A100-SXM4-80GB 对 attention 做 profile 分析。文章对比朴素 attention 与 in-place 版本,发现把 masked_fill 换成 masked_fill_ 后,每次前向传播可省去一个 Memcpy kernel。
PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,再转为可流式训练的语料。团队用 Lance 做数据构建与筛选、MDS 做流式训练,并将文本编码器从 T5Gemma 换成 Qwen3-VL、改为训练时实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练约多花 1 天)。
Google Chrome 团队开发者关系工程师 Thomas Steiner 在 Hugging Face 博客中,试验了拟议的 Cross-Origin Storage(COS)API 如何解决 Transformers.js 的跨源缓存重复问题。
Hugging Face 在 PEFT 库中对比了 LoRA 之外的多种参数高效微调技术,并指出仅凭论文结果难以判断哪种技术最优。其统计显示,Hugging Face Hub 上提及单一 PEFT 技术的 20,834 个模型卡中有 20,509 个(98.4%)提到 LoRA,外部站点 10,000 个图像生成 checkpoint 中 7,111 个为 LoRA。
PyTorch 性能剖析系列第二部分用 nn.Linear(bias=True)替换手写的 matmul-add,并堆叠三层加激活构成 MLP,在 NVIDIA A100-SXM4-80GB 上分析 profiler trace。
Hugging Face 发布教程,介绍如何保留 GitHub Actions 调度、把 CI 任务放到 Hugging Face Jobs 上运行,通过 huggingface/jobs-actions 桥接把 GitHub Actions 任务变成 HF Job 内的临时自托管 runner。
DharmaOCR 团队将 Direct Preference Optimization(DPO)用于结构化 OCR 任务,以正确转录为 chosen、退化循环为 rejected 构建偏好数据,在 SFT 之后追加第二阶段训练,使所有测试模型家族的文本退化率平均下降 59.4%,最高降幅 87.6%(Nanonets-OCR2-3B 从 1.61% 降至 0.20%)。