跳到正文

#Agent

今日 20 条
今天10月3日周六
  1. BestBlogs.dev42

    华为云果办 OfficeAce 更新:跨设备记忆协同、人机共写与快慢推理模式

    华为云果办 OfficeAce 完成版本迭代,新增跨设备跨系统记忆协同、人机共写、远程调度及推理快慢模式选择,对话上下文与任务进度可云端自动同步,解决 PC 与手机切换时的任务中断问题。产品内置账号专属记忆体系,自动沉淀用户习惯、风格与偏好,覆盖 PC、移动及小程序端。

  2. TechCrunch · AI36

    Airbnb CEO Brian Chesky:AI 智能体需要自己的操作系统

    Airbnb 本周随秋季更新上线新的 AI 搜索,CEO Brian Chesky 表示聊天机器人不适合电商,未来三到六个月公司将探索支持多人同时使用的“multiplayer”AI 界面。他认为行业缺少真正为 AI 打造的操作系统,AI 应在内核层运行,并计划让 Airbnb 应用变得更 agentic、通过 MCP 与其他智能体互通。

  3. TechCrunch · AI62

    Shopify 推出 Canvas,通过对话让 AI 搭建网店

    Shopify 发布建站工具 Canvas,商家通过与 AI 智能体 Sidekick 对话即可搭建店铺,Canvas 实时渲染店铺真实代码而非静态预览,可测试交互与动画并查看不同屏幕尺寸下的效果。为此 Shopify 让 Sidekick 直接操作主题文件,并简化了主题架构。该产品尚处早期,暂不支持第三方主题、应用区块与扩展、多市场、翻译、灰度发布和主题更新,且仅限桌面端。

  4. TechCrunch · AI56

    AWS 发布开源决策模型 Strands Decider 2B

    AWS 发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,可在本地运行,用于在预设选项中做选择并给出置信度。该模型由 AWS 杰出工程师 Marc Brooker 在看过 TypeSafe 的 Jev 后自行开发,曾在同规模模型的 Jevbench 排名上短暂登顶,随后由 Strands Labs 整理发布。

  5. The Verge · AI66

    苹果将限制 Mac 全盘访问权限,称 AI 智能体大幅增加风险

    苹果宣布将在 macOS 上为全盘访问权限增加新的限制,要求用户通过非常明确的主动操作才能授予应用这一权限。苹果表示,部分开发者使用全盘访问的方式可能让用户面临风险,暴露文件、邮件、信息和浏览历史等内容,而随着 AI 智能体能力与自主性增强,这类访问带来的风险会大幅上升。苹果未说明该更新的具体推出时间。

10月2日周五
  1. GitHub Blog · AI & ML22

    AI 正在改变开发者工作,GitHub 给出三项需要强化的技能

    GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 省下的时间解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,从而发现首个模型遗漏的问题。

  2. The Verge · AI34

    AI 幻觉让"顾客永远是对的"更难应付:服务员、护林员和幼教都在被 ChatGPT 反驳

    生成式 AI 的普及正让服务业员工面对越来越多"拿 ChatGPT 当权威"的顾客:纽约服务员 Madison 称有客人以 ChatGPT 为由否认菜品含贝类过敏原,还有客人拒绝侍酒师、改问 ChatGPT,甚至点出不存在的酒。Meta 新 AI 智能体 Muse 的推出可能加剧这一问题,护林员、幼教和餐厅经理也报告了 AI 编造的营地行程、育儿作息和预订要求。

  3. Hugging Face Blog32

    Hugging Face 发布 AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建的 AutoSynthData 利用目标模型的失败案例与更强教师的成功轨迹,定位能力缺口并生成、验证新的可执行任务用于后训练,课程随模型改进转向其仍难完成的任务。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成任务需满足可行性、真实性与难度三项属性,验证器则要求一致性、可靠性与完备性。

  4. Latent Space34

    MIT 的 Alex Zhang 谈 RLM、GPU 内核与智能体集群:学术界应下工业实验室不敢下的赌注

    MIT 研究者 Alex Zhang 在 Latent Space 播客中介绍了其 RLM(递归语言模型)工作:基于 RLM 的 harness 是首个接近解决 ARC-AGI-3 的系统,早于 OpenAI 的 Astra。他还讨论了 AI 生成 GPU 内核、harness 作为组合泛化器、Prime Agent 与持久化子智能体,以及 OpenAI 万级智能体实验、Kimi 集群等方向。

  5. BestBlogs.dev82

    谷歌发布 Gemini 4 系列首款旗舰模型 Argon

    谷歌于 9 月 30 日发布 Gemini 4 系列首款旗舰模型 Argon,在软件工程、金融研究、法律研究及企业自动化等领域评测中表现领先。Argon 支持最高 100 万单次词元输出,高于此前的 6.4 万,缓存输入价格较前版本降低 95%,并能自主发现、验证并修复软件漏洞,目前已向部分合作方开放。随着 Argon 落地,谷歌取消了原定于 6 月发布的 Gemini 3.5 Pro 迭代计划。

    推荐理由:谷歌 Gemini 4 系列首款旗舰模型 Argon 的能力与定价变化,以及随之取消的 Gemini 3.5 Pro 迭代计划。

10月1日周四
  1. BestBlogs.dev28

    企业真正用上 AI 后,安全该怎么测?AccessB 研讨会回顾

    AccessB 线上研讨会指出,企业将大模型和 Agent 接入业务后,安全风险已从"模型回答错误"扩展到敏感数据泄露、Prompt 注入、第三方 API 风险及 Agent 工具调用越界。传统 Web 安全测试难以发现多轮交互中的行为偏移和权限访问问题,建议企业从高风险业务场景入手,对模型、数据、权限及执行链路做深度测试,逐步构建 AI 安全评测体系。

  2. Latent Space82

    Google DeepMind 发布 Gemini 4 Argon,支持 1M 输出 token

    Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,先在 Fairwind 计划的政府用户与可信网络防御者中开放,后续再向开发者、企业和消费者开放。

    推荐理由:汇总 Gemini 4 Argon 的基准、定价与第三方评测分歧,可对照其与 Astra、Opus 5.5 的能力与成本差异。