Simon Willison 回顾 2026 年 LLM 大事记:从 Claude Opus 4.5 到 OpenClaw
Simon Willison 在 WeAreDevelopers World Congress 的主题演讲中按时间线梳理了 2026 年 LLM 领域的关键进展。
Simon Willison 在 WeAreDevelopers World Congress 的主题演讲中按时间线梳理了 2026 年 LLM 领域的关键进展。
Simon Willison 在 2026 年 9 月 24 日的笔记中表示,与编码智能体协作越久,他越确信这些工具让软件工程变得"更难"。他认为智能体能带来惊人的成果,但释放其全部潜力需要极高的纪律性和知识储备。
一位新入职大公司的工程师称,团队里的规格、代码、测试、PRD、工单及其处理、报告等全部由 Claude Code 生成,从 L1 到 L7 的工程师都在做同一件事——和 Claude 对话。没人喜欢这种做法,却被高层要求尽可能多地产出,因为管理层认为提交代码不是瓶颈;有人每天工作 12 到 13 小时只为按回车,没人真正阅读产出内容。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需人来负责,但审查力度应随风险而定;Skills 与 MCP 解决的是不同问题,MCP 提供连接工具和数据的标准,Skills 则封装团队流程与最佳实践;RAG 并未消亡,它与 Agent、Skills、MCP 可以共存于同一工作流。
OpenAI 宣布不再使用 SWE-bench Verified 评测前沿编程能力,原因是该基准正日益受到污染,且存在测试缺陷与训练数据泄漏问题,已无法准确衡量模型进展。OpenAI 建议改用 SWE-bench Pro。