Andrej Karpathy总结了2025年AI领域六大范式转变,包括基于可验证奖励的强化学习(RLVR)、Vibe Coding等核心技术突破。RLVR通过在可自动验证奖励的环境中训练LLM,使模型自发形成类人推理策略,成为2025年最重要的训练技术革新。这些转变从根本上改变了大语言模型的训练范式和能力边界。
AI 编程
AI 辅助编程、代码生成、Vibe Coding、Copilot 类工具与最佳实践
AI 编程 · 精选产品
GPT-6 Astra
94OpenAI's most capable model for end-to-end work
GPT-6 Astra 是 OpenAI 迄今最强大的 AI 模型,面向复杂推理、软件工程、科学研究及专业工作场景,支持异步工具调用与多步骤智能体工作流。
Claude Fable 5
91Anthropic's most capable model ever — free until June 22
Anthropic 推出的最强 AI 模型 Claude Fable 5,在代码、科学、视觉等多领域刷新 SOTA 基准,面向开发者和企业用户提供极致推理与自动化能力。
WeatherNext 3
88Our most advanced and accurate global weather AI model
Google 推出的旗舰 AI 天气预报模型,通过实时卫星数据、小时级刷新和高分辨率降水预测,为搜索、地图、Gemini 及云平台提供精准气象服务。
GPT-5.6
88A new standard for intelligence and efficiency
OpenAI 发布 GPT-5.6 模型家族,提供旗舰版(Sol)、均衡版(Terra)和轻量版(Luna)三档选择,面向开发者推出程序化工具调用、多智能体并行执行及显式提示缓存等新能力。
Atlas by World Labs
87Turn text, pics, video, + 3D into camera-controlled HD video
Atlas 是 World Labs 推出的全模态世界模型,支持文本、图片、视频和 3D 输入,可生成摄像机可控的 1440p 高清视频,并具备场景重建与机器人空间仿真能力。
Google Gemini 3.8 Flash and Cyber
85Next-gen Gemini for agents, reasoning, and cyber security
Google 推出新一代 Gemini 3.8 Flash 模型,专为 AI 智能体工作流与网络安全场景优化,支持长链推理、自主任务执行与漏洞检测,以低成本高速度提供企业级 AI 能力。
Glaze by Raycast
85Create your own Mac apps by chatting with AI
Glaze 是 Raycast 团队推出的 Mac 端 AI 应用生成工具,用户通过自然语言描述即可生成能离线运行、驻留 Dock 的真实 Mac 原生应用,让软件真正个人化。
Hy4 preview
84Tencent’s 770B open model for long-horizon work
腾讯开源的770B MoE大模型,专为长程自主代理任务设计,能自主完成编程、游戏开发及复杂文档分析,并自动运行测试与修复Bug。
Spline V2
84Best 3D platform for the agentic era
Spline V2 是一款面向 AI 时代的全新重构 3D 编辑器,集成 AI Agent 模式与 MCP 协议、WebGPU 渲染引擎及 PBR/HDR 工作流,让设计师和开发者能更高效地创作交互式 3D 内容。
Microduck
84A tiny open-source biped you can train yourself
Microduck 是由 Hugging Face 与 Pollen Robotics 联合推出的 25cm 开源双足机器人,售价 $399,专为强化学习仿真到现实迁移(sim-to-real)研究设计,自带 7 种预训练行为和完全开放的软件栈。
Caddi
84Agent that builds agents by only showing your work only once
Caddi 通过录制一次操作演示,自动将用户的后台工作流程转化为可在真实工具中持续运行的 AI 自动化智能体,无需开发者或复杂配置。
Ojin
83Talk to an AI Agent with a real face and voice, in real time
Ojin 提供带有真实面孔和声音的 AI 智能体 API,支持实时打断式自然对话,只需一张照片即可创建可交互的数字人形象。
ChatGPT Images 2.5
82Sharper visuals, faster flow, better creative control
ChatGPT Images 2.5 是 OpenAI 推出的下一代图像生成模型,通过更清晰的细节、更快的生成速度和更精准的编辑能力,帮助用户将草图、提示词和参考图片转化为高质量视觉内容。
Agentic Video Understanding in Gemini
82Agentic video analysis for faster, smarter Gemini insights
Google Gemini 推出智能体视频理解模式,让模型自主决定观看策略,大幅降低 token 消耗和成本,同时提升长视频分析准确率。
Gemini 3.8 Flash
82Most intelligent workhorse yet for coding and agents
Google 推出的最新 Flash 系列 AI 模型 Gemini 3.8 Flash,专为编程、智能体任务和多步推理设计,以极具竞争力的价格提供高性能的代码生成与自主任务执行能力。
Gemini Omni 1.1 Flash
82Our newest multimodal model for video generation and editing
谷歌推出的多模态 AI 视频生成与编辑模型,支持场景延伸、帧插值、4K 超分辨率等专业级视频制作能力。
Gemini 3.7 Flash
82Google's smartest workhorse yet for coding & agents
Google 推出 Gemini 3.7 Flash,专为编程和 AI 智能体任务优化的高性能轻量级大语言模型。
Human Behavior
82Product analytics told you what happened. We handle it.
Human Behavior 是一款 AI 驱动的产品分析工具,不仅捕获用户行为和会话回放,还通过后台 AI 智能体自动分析问题、触发修复动作(如发邮件、更新 CRM、提 PR),实现产品改进的闭环自动化,无需人工盯仪表盘。
Ito
82AI code review that runs your code
Ito 是一款 AI 代码审查工具,通过在临时环境中实际运行代码来验证 PR 的运行时行为,而非仅依赖静态分析,帮助团队在代码合并前发现真实 Bug。
Prime Agent
82A coding agent that can refine its own harness
Prime Agent 是一个开源的自改进编程智能体,通过递归语言模型(RLM)和持续迭代框架(Continual Harness)两大核心抽象,让 AI 编程助手能够自我优化其执行环境,在 ARC-AGI-3 基准上达到 95.5% 的顶尖水平。
Soup CLI
82Fine-tune an 8B LLM on a 4 GB laptop GPU
Soup CLI 是一个开源命令行工具,允许开发者在仅有 4GB 显存的消费级笔记本 GPU 上微调 80 亿参数的大语言模型,通过逐层流式加载技术大幅降低显存峰值占用。
Coldtea.ai
82Make your software delivery self-driving
Coldtea 是一款面向开发团队的 Agentic IDE,通过 AI 编码代理、视觉 QA 代理和 AI 生产监控的协同工作,解决团队在 AI 加速交付背景下频繁引入生产故障的问题。
Muse Code
82Meta’s terminal agent for long-horizon coding
Muse Code 是 Meta 推出的终端编程智能体,基于 Muse Spark 1.2 模型,支持长周期任务、仓库级代码执行与内置验证,旨在解决开发者处理复杂、跨文件、长时间编码任务的效率问题。
Cloudflare Wallets
82the programmable wallet for the agentic Internet
Cloudflare Wallets 为 AI 智能体提供可编程钱包层,使其能够自主发现、使用并支付 API 和数字服务,构建下一代 AI 应用的金融基础设施。
ngrok AI Gateway
82One private gateway for every AI model
ngrok AI Gateway 为开发者提供统一的 AI 模型网关,通过单一密钥和 URL 路由管理 OpenAI、Anthropic 及自托管模型,解决多模型接入混乱、私有模型暴露风险和缺乏统一可观测性的问题。
DeepSeek-V4-Flash-0731
82Frontier agent intelligence at Flash prices
DeepSeek-V4-Flash-0731 是 DeepSeek 官方发布的高性能轻量级大语言模型,以低价格提供媲美旗舰模型的 Agent 推理能力,并原生支持 Responses API 与 Codex CLI。
Claude Opus 5
82Near-Fable 5 intelligence at half the price
Claude Opus 5 是 Anthropic 推出的新一代旗舰大语言模型,以一半的价格提供接近顶级的智能水平,专为长时运行的 AI Agent、编程和专业工作场景优化。
Gemini 3.6 Flash Family
82Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber
Google 发布 Gemini 3.6 Flash 系列新模型,主打高效率、低延迟和高可靠性,专为大规模 AI Agent 构建场景优化。
CartAI
82The AI agent that handles checkout.
CartAI 是一个面向开发者的 AI 结账代理 API,能在任意电商平台自动完成购物结账全流程,无需商家侧集成,同时内置支付、商品搜索和佣金变现能力。
Clark
82An AI coworker with its own cloud computer
Clark 是一个拥有独立云端计算机(浏览器、终端、文件、代码环境)的 AI 协作员,用户可以将复杂任务完整交给它异步完成,涵盖研究、代码、文档等多种交付物。
Kimi K3
82The world's first open 3T-class model
Kimi K3 是月之暗面推出的全球首个开源 3T 参数级大模型,具备原生视觉能力和百万 token 上下文窗口,面向代码生成、科学推理等高难度任务场景。
Kimi K3
82The world's first open 3T-class model
Kimi K3 是全球首个开源的3万亿参数级大模型,覆盖编程、知识工作和推理任务,支持原生多模态与100万上下文窗口。
Kimi K3
82Open frontier intelligence: 2.8T params, 1M-token context
Kimi K3 是月之暗面发布的 2.8T 参数开源大语言模型,支持百万 token 上下文窗口和原生视觉能力,面向代码、知识工作和复杂推理场景。
Coasty
82A Computer-Use-Agent that runs legacy software like a human
Coasty 是一个计算机操控 AI 代理,能像人类一样自主操作桌面软件(无需 API),主要解决医疗、保险、税务等行业中遗留系统自动化难题。
GPT-Live
82Full-duplex voice for ChatGPT
GPT-Live 是 OpenAI 为 ChatGPT 推出的全双工语音模型,支持同步听说、自然处理停顿与打断,解决了传统语音助手交互不自然、延迟高的问题。
Context.dev
82One API to scrape, enrich, and extract the internet
Context.dev 是一个面向 AI 产品和 Agent 的 Web 上下文 API,通过单一接口提供网页抓取、结构化数据提取、Markdown 转换、截图及公司品牌信息等能力,帮助开发者快速为 AI 应用注入互联网数据。
Sequence Agentic
82Money movement for AI agents
Sequence 是面向 AI Agent 的金融执行层,允许 AI 代理通过 API 真实地发送、拆分和路由资金,同时通过权限隔离、服务端限额和审计日志确保安全可控。
Claude Sonnet 5
82AI that plans, acts, and gets work done
Anthropic 推出的最新 Claude Sonnet 5 模型,专注于 Agentic AI 能力,能够自主规划、执行任务,适用于编程和日常专业工作场景。
Tabstack Browser Automation
82Automate the web in your app or agent, no browser to host
Tabstack 是 Mozilla 推出的浏览器自动化 API,开发者只需一句自然语言即可驱动真实浏览器完成网页操作,无需自行托管浏览器或配置框架。
v0 Design Systems 2.0
82Build with your components, colors, fonts, and patterns
v0 Design Systems 2.0 允许开发者和设计师将现有设计系统(GitHub、npm、Figma、Storybook 等来源)导入 v0,自动学习组件用法并生成可交互的 AI 编码 playground,解决 AI 生成代码与团队设计规范脱节的问题。
Cursor for iOS
82Build with coding agents from anywhere
Cursor 推出 iOS 原生应用,让开发者可以随时随地通过手机启动云端 AI 编程 Agent、监控任务进度并合并 PR,打破本地机器的时空限制。
Skybridge
82The full-stack open source React framework for MCP Apps
Skybridge 是一个开源的全栈 React 框架,专为构建运行在 AI 助手(如 ChatGPT、Claude)内部的 MCP 应用而设计,解决了 MCP 应用开发工具链缺失的问题。
Claude Opus 4.8
82Reasoning model with 1M context for agentic work
Claude Opus 4.8 是 Anthropic 推出的推理型大语言模型,拥有 100 万 token 超长上下文窗口,专为开发者和企业团队处理复杂代码、长周期智能体任务和多日工作流而设计。
NVIDIA Nemotron 3 Ultra
82The first open frontier model built for agents
NVIDIA 发布的 550B 混合专家开源大模型,专为多步骤 AI Agent 任务优化,以开源经济成本实现前沿推理能力。
Nemotron 3 Ultra by NVIDIA
82Powers faster, efficient reasoning for long-running agents
NVIDIA 发布的 550B 参数混合专家开源大模型,专为长时间运行的 AI Agent 优化,相比同类开源前沿模型推理速度提升 5 倍、成本降低 30%。
Spectron
82Agent memory you can trust
Spectron 是一个为 AI Agent 设计的统一记忆基础设施,将图数据库、向量、文档和结构化数据整合在单一 ACID 事务基底上,解决多存储拼接、数据溯源困难和记忆不可信的问题。
Viso Now
81Build computer vision applications with AI
Viso Now 是一个自构建 AI 视觉平台,用户只需用自然语言描述需求,即可将图像、视频和摄像头流转化为可运行的计算机视觉应用,无需模型训练、数据标注或编写代码。
AI Observability by OpenObserve
81OpenTelemetry-native observability for agents and LLMs
OpenObserve 为 AI Agent 和 LLM 提供 OpenTelemetry 原生的全链路可观测性平台,帮助开发者精确追踪每次 Agent 会话的时间消耗、API 成本与质量问题。
Harden
81A security layer for AI coding agents
Harden AIF 是一款面向 AI 编程代理的本地安全防护工具,通过在工具调用执行前进行上下文感知的安全检测,防止恶意或危险操作,且全程数据不离本机。
Catenary
81Spatial canvas IDE for AI coding agents
Catenary 是一个空间画布式本地 AI 编程 IDE,允许开发者通过可视化“电缆”连接和编排多个 AI 代理协同工作,解决多 AI 代理上下文混乱和终端标签页泛滥的问题。
Hyperprobe
81Lets your AI agents debug production without redeploying
HyperProbe 让 AI 编程助手(如 Claude Code、Codex、Cursor)能够在不重新部署的情况下,向生产环境中的运行服务注入只读探针,捕获未被记录的变量状态,从而帮助后端团队一次性闭环难以本地复现的线上 Bug。
Agent Builder by Airtop
81Build agents that heal themselves.
Airtop Agent Builder 是一款 AI 自愈代理构建平台,用户用自然语言描述工作流,系统自动编译为可执行自动化代码,并在运行失败时自动诊断、修复并验证,无需人工干预。
Devin Voice
80You say it, Devin ships it
Devin Voice 是 Cognition AI 为其 AI 软件工程师 Devin 推出的语音交互界面,用户只需开口说出需求,Devin 即可自动规划、编码并交付软件成果。
screenpipe
80AI that records your computer work to power agents.
screenpipe 是一款本地优先的全屏录制与活动追踪工具,通过 MCP 协议将用户的电脑工作历史开放给 AI 代理,让用户无需手动重建工作上下文即可快速检索通话、文档和代码信息。
Cline Desktop App
79An open-source app for open-weight models
Cline Desktop 是一款开源 AI 编程助手桌面应用,允许开发者自由选择模型与服务商,支持多 Agent 并发、任务自动化及插件市场,打破闭源生态束缚。
Noodle Seed
79Your product in AI and AI in your product
Noodle Seed 为软件团队提供 AI Agent 就绪的托管运行时,帮助开发者将产品工作流暴露给 AI Agent,并统一管理身份、权限、密钥和审计,无需手动拼接 MCP SDK 和基础设施。
Perplexity Hybrid Compute
78Splitting AI tasks: Cloud for research, Mac for privacy
Perplexity 推出混合计算功能,将云端 AI 与本地 Mac 模型结合,实现高性能推理与本地文件隐私保护的兼顾。
Mastra Factory
78From issue to production, run by agents.
Mastra Factory 是一个开源的 AI Agent 驱动软件交付环境,将从 Issue 提出到代码合并的完整开发流程自动化,让 AI Agent 负责规划、编码与 PR 审查。
Switch
78Bring any AI agent into Slack, Teams & Discord. Open-source.
Switch 是一款开源工具,让 AI 智能体以命名参与者身份加入 Slack、Teams、Discord 等协作平台,共享团队上下文并跨项目复用,打通 AI 与团队协作工具的壁垒。
NVIDIA Personal AI Router
78Turn your PCs and Macs into a private AI cluster
NVIDIA PAIR 将局域网内的多台 PC 和 Mac 组成私有 AI 推理集群,通过统一端点自动路由请求,实现本地隐私保护的 AI 应用运行。
AI 编程 · KOL 观点
Karpathy提出LLM不应被视为聊天机器人,而应被理解为新型操作系统的内核进程,能够协调多模态输入输出、代码执行、浏览器访问和记忆存储等功能。他将当前主流LLM(GPT、PaLM、Claude、Llama)类比为Windows/macOS/Linux,认为我们正处于一个全新计算范式的早期阶段。将LLM看作聊天机器人,就如同将早期计算机仅视为计算器一样短视。
Andrej Karpathy 提出了一套完整的 AI 工程方法论,核心是将上下文窗口视为代码(Software 3.0),用工程化思维(规范设计、差异审查、评估循环)替代随意的 Prompt 尝试。他还推广了并行 Agent 管理模式和 CLAUDE.md 配置文件,构建出一套从世界观到具体工具的完整实践体系。
Anthropic的Claude Code创始人Boris Cherny披露,他已8个月未亲手写过一行代码,完全依靠管理数千个AI Agent完成软件开发工作。截至2026年5月,超过80%合并进Anthropic代码库的代码由Claude自主撰写,代码产出量较年初增长8倍。更值得关注的是,该系统已开始自主浏览GitHub和X寻找下一步构建方向,递归自我改进正在成为现实。
安全研究员 Johann Rehberger 发布了一个针对 Claude Code Opus 5 Auto Mode 的可复现漏洞利用链,通过网页摘要请求实现了 60-80% 成功率的远程代码执行攻击,与 Anthropic 此前声称'基本解决'提示注入问题形成鲜明对比。更值得关注的是,Auto Mode 的安全分类器不仅未能阻止攻击,还主动阻止了模型自身的清理补救操作,形成'倒置失败'。Anthropic 将该漏洞报告关闭为'Informative',称这属于'设计如此'的行为。
安全研究员 Boris Cherny 通过构造多步骤攻击链,成功以 60-80% 的成功率突破了 Claude Code Opus 5 的 Auto Mode 安全防护,实现了代码执行。这与 Anthropic 委托第三方(Trajectory Labs)评估得出的 0.00% 攻击成功率形成直接矛盾。攻击核心在于利用 Python 模块路径劫持(struct.py 影子模块),绕过模型对直接二进制执行的拒绝。
Claude Code的创建者Boris Cherny分享了132+个真实工作流中的实用技巧,涵盖并行运行多个Claude实例、子代理调度、hooks自动化、工作流设计等高级用法。内容来自一线开发者的亲身实践,技术深度与可操作性兼具,是目前最权威的Claude Code使用指南之一。
Anthropic 公开了其内部 AI 辅助编程的规模化数据:截至2026年5月,Claude 已负责超过80%的生产代码提交,工程师人均代码产出提升8倍,开放性任务成功率达76%(半年内提升50个百分点)。这是业界首份来自前沿实验室的、基于真实生产环境的 Agentic 编程规模化原始数据报告,而非基准测试或演示。文章提炼了可供工程团队直接参考的工作流模式,如 maker-checker 循环等。
Anthropic内部人员Boris Cherny分享了在生产环境中使用Claude写代码的最佳实践:原型代码可以黑盒处理,但生产代码应设置比人类更高的质量标准。Anthropic内部使用lint规则、自动化测试、Claude驱动的模糊测试、自动代码审查等多重护栏来保障AI生成代码质量。开发者的核心职责是'守住代码质量的标准线'。
Andrej Karpathy 与 Sarah Guo 深度对话,探讨 AI 代理(Code Agents)的现状与未来,重点介绍其 AutoResearch 项目——让 AI 代理自主完成实验设计、数据收集和模型优化的闭环研究流程。同时讨论了自然语言编程的二阶效应、AI 时代的相关技能、模型分化(Model Speciation)以及 AI 对就业市场的影响。
安全研究员在Anthropic宣称提示注入问题'基本解决'仅四天后,成功构建了针对Claude Code Auto Mode的间接提示注入攻击链,测试成功率达60-80%。攻击利用Python模块影子覆盖机制,通过多步骤链式操作绕过AI安全检测,最终实现远程代码执行。Anthropic的回应坦承Auto Mode从未被设计为安全边界,仅为便利性功能。
Karpathy 描述了编程范式从「氛围编程」(vibe coding)向「代理工程」(agentic engineering)的演进,提出了 Software 3.0 的概念——通过提示词和上下文而非显式代码来编程。他强调 LLM 如同易错的「幽灵」,需要新型判断力,并指出思考可以外包但理解力永远不能外包。
安全研究员 Johann Rehberger 证明了 Claude Code Auto Mode 存在通过 Python 模块劫持实现远程代码执行的漏洞,成功率高达 60-80%,而 Anthropic 委托的第三方评估却声称该模式零提示注入攻击成功率。Anthropic 将此漏洞披露归类为「按设计运行」,拒绝修复,导致其安全营销宣传与实际漏洞现实之间出现公开矛盾。文章深刻揭示了基准测试覆盖范围与真实攻击面之间的本质差距,以及 AI 分类器「批准命令」与「命令执行结果安全」之间的语义错位。
文章通过一个真实的多实例部署导致重复发邮件的案例,揭示了「氛围式调试」(让AI代理在没有确定性复现步骤的情况下调试)比「氛围式编码」危险得多的原因:AI只能基于症状做模式匹配,从未观测过真实运行时状态,错误的修复猜测不会报错,而是生成看似合理却掩盖真实问题的diff,制造第二个bug。核心建议是:调试前先写出可复现的失败测试,以此作为给AI最好的「prompt」;连续3次失败后重置会话,避免被AI自身的错误推断污染上下文。
Anthropic Claude Code负责人Boris Cherny分享了Claude Code从简单终端原型成长为占GitHub公开提交4%的AI编程工具的历程,并探讨了编程问题被'解决'后的下一步。他分享了反直觉的产品原则,包括刻意缩减团队规模、给予无限token预算,以及AI如何重塑所有专业工作的未来图景。
Claude Code创始人Boris Cherny分享了AI编程工具的构建历程与工作流实践,包括每天并行运行5个Claude实例提交20-30个PR的高效模式。他深入探讨了AI时代软件工程师角色的演变——编码门槛降低,但工程师的职责边界正在向产品、设计等领域扩展融合。
Spotify首席架构师Niklas Gustavsson分享了公司在AI编程领域的前沿实践:73%的PR已由AI生成,任何人都能在1-2小时内完成原型开发。对话探讨了IDE的终结、AI代理处理2000万行代码的经验,以及异步编程工作流的组织变革。
Claude Code创始人Boris Cherny建议用户每6个月清空一次AI指令文件(如CLAUDE.md),因为底层模型持续升级后旧指令可能反而成为限制。他强调验证机制比提示词工程更重要,并指出Opus 5已大幅增强对提示注入的抵御能力,智能体可连续工作数天甚至数月。Anthropic内部每天运行20-30个Claude例行任务用于代码维护,标志着AI工作流进入新阶段。
Andrej Karpathy 分享了一套以 LLM 为核心的个人知识库构建方法:将原始资料(PDF、文章、图片等)存入 raw/ 文件夹,由 LLM 自动编译成可互查的 Markdown Wiki,人类角色从「写笔记」转变为「监督 LLM 写笔记」。该系统已在其个人项目中积累约 100 篇文章、40 万词,全部由 LLM 端到端生成与维护。这一「LLM 驱动内容,人类监控」的范式与传统 Obsidian/Notion 手动维护方式有本质区别。
Anthropic工程师Boris Cherny(Claude之父)分享了一项实验:让Claude自主维护其应用程序,在数周内提交了388个完全由AI编写的PR,其中180个已被合并。工程师唯一的工作是点击按钮决定是否合并代码。该实验覆盖iOS、Android、桌面、Web、CLI和Agent SDK六个环境,Claude每日自动执行崩溃检测、重复代码合并、死代码清理等任务。
Andrej Karpathy在2025年2月创造了'vibe coding'概念,描述低审查的AI辅助编程方式。到2025年12月,他80%的代码已由AI生成,并于2026年4月宣布vibe coding已过时,取而代之的是他称为'agentic engineering'的更严格工程纪律。这一18个月的思维演变代表了专业软件开发的未来走向。
Anthropic工程师Boris Cherny披露,Claude已在Anthropic内部软件上运行每日自动维护任务数周,共创建388个PR,其中180个经人工审核后被合并,合并率达46%。该系统通过Slack频道协调,覆盖iOS、Android、桌面、Web、CLI及Agent SDK等全平台。
Anthropic工程师Boris Cherny分享了一个实验:让Claude自动承担应用日常维护工作,包括崩溃检测修复、重复代码统一、死代码清理等,数周内提交388个PR,180个被合并。这一工作流展示了AI Agent在软件工程自动化维护领域的实际落地潜力。
Claude Code创始人Boris Cherny透露,Anthropic在Opus 5发布时删除了超过80%的系统提示词,因为新模型已能自主完成旧模型需要纠正的行为。他建议用户每六个月清空一次CLAUDE.md和技能配置重新测试,核心结论是:保留'不变量'(导航上下文、业务信息),删除'程序'(任务执行步骤),让更强的模型自主决策。
Boris Cherny(Anthropic工程师)分享了一个实验:让Claude自动承担应用日常维护工作,包括崩溃模糊测试、重复代码统一、死代码清除、抽象层修复等例行任务。几周内共提交388个PR,180个经人工审核后合并,整体效果超出预期。
Andrej Karpathy 探讨了 AI 代码智能体的现状与未来,重点介绍了其 AutoResearch 项目——一个能够自主完成 AI 研究闭环(实验设计、数据收集、训练优化)的智能体系统。他还深入分析了自然语言编程的二阶效应、AI 时代的相关技能演变、模型物种化趋势以及对就业市场的影响。
Anthropic工程师Boris Cherny分享了Claude Code的核心方法论:随着模型能力提升,应主动删除而非增加系统提示词。Opus 5已能用单条指令完成10万行代码重写等复杂任务,并行代理架构使大规模自动化成为现实。提示词注入等安全问题也通过多层防御机制得到基本解决。
Karpathy 通过让 LLM 用100万 token(约10美元)将《指环王》段落渲染为3D场景的实验,揭示了 AI 带来的不仅是能力提升,更是一场可行性边界的革命。大量原本'不值得做'的定制化工作,因边际成本趋近于零而从'没人会做'变成'为什么不呢'。这标志着一次范式转变:不是质量前沿,而是可行性前沿的突破。
Claude Code创始人Boris Cherny分享了其利用AI代理每天合并10-30个PR的工作流程,涵盖自动模式、上下文极简主义、CLAUDE.md配置、验证循环和并行代理等核心实践。核心论点是软件工程师的角色正从「写代码」转向「审查和指挥AI代理」。这代表了一次范式级别的职业转型信号。
2026年AI领域经历了剧烈的情绪转变:从2025年底的普遍悲观(AGI时间线拉长、AI Agent被认为不可用)到Claude Opus 4.5发布后的全面看多。Karpathy等顶级工程师公开表示感到被AI'甩在身后',编程职业正被重构。文章试图梳理这一快速反转背后的7条关键证据线,并审视哪些是真实信号、哪些可能只是新一轮炒作周期。