Karpathy 提出「循环工程」(Loop Engineering)概念,认为构建长时运行 Agent 的核心瓶颈不是模型智能,而是外部框架(Harness)的设计。他给出了包括角色分离、契约先行、状态持久化、自动重启等九条黄金法则,为多日运行的 AI Agent 开发提供了系统性方法论。
AI Agent
自主智能体、多 Agent 协作、Agentic Workflow 与 Computer Use
AI Agent · 精选产品
GPT-5.6
88A new standard for intelligence and efficiency
OpenAI 发布 GPT-5.6 模型家族,提供旗舰版(Sol)、均衡版(Terra)和轻量版(Luna)三档选择,面向开发者推出程序化工具调用、多智能体并行执行及显式提示缓存等新能力。
Clark
82An AI coworker with its own cloud computer
Clark 是一个拥有独立云端计算机(浏览器、终端、文件、代码环境)的 AI 协作员,用户可以将复杂任务完整交给它异步完成,涵盖研究、代码、文档等多种交付物。
Verse
82Build and hire autonomous AI employees from a single prompt
Verse 让用户通过一句提示词即可创建并「雇用」具备完整数字身份和工具能力的自主 AI 员工,代替人类 24/7 独立完成工作任务。
ChatGPT Work
82Partner for your most ambitious work
ChatGPT Work 是 OpenAI 面向职场场景推出的 AI 智能体产品,能够跨应用和文件持续执行复杂任务,将用户目标转化为完整的工作成果。
Coasty
82A Computer-Use-Agent that runs legacy software like a human
Coasty 是一个计算机操控 AI 代理,能像人类一样自主操作桌面软件(无需 API),主要解决医疗、保险、税务等行业中遗留系统自动化难题。
Context.dev
82One API to scrape, enrich, and extract the internet
Context.dev 是一个面向 AI 产品和 Agent 的 Web 上下文 API,通过单一接口提供网页抓取、结构化数据提取、Markdown 转换、截图及公司品牌信息等能力,帮助开发者快速为 AI 应用注入互联网数据。
Sequence Agentic
82Money movement for AI agents
Sequence 是面向 AI Agent 的金融执行层,允许 AI 代理通过 API 真实地发送、拆分和路由资金,同时通过权限隔离、服务端限额和审计日志确保安全可控。
Claude Sonnet 5
82AI that plans, acts, and gets work done
Anthropic 推出的最新 Claude Sonnet 5 模型,专注于 Agentic AI 能力,能够自主规划、执行任务,适用于编程和日常专业工作场景。
Tabstack Browser Automation
82Automate the web in your app or agent, no browser to host
Tabstack 是 Mozilla 推出的浏览器自动化 API,开发者只需一句自然语言即可驱动真实浏览器完成网页操作,无需自行托管浏览器或配置框架。
Cursor for iOS
82Build with coding agents from anywhere
Cursor 推出 iOS 原生应用,让开发者可以随时随地通过手机启动云端 AI 编程 Agent、监控任务进度并合并 PR,打破本地机器的时空限制。
Framer 3.0
82With Agents, Branching, Community, and an all-new design
Framer 3.0 是一款面向设计师和团队的 AI 驱动网站构建工具,通过引入 AI Agents、分支协作和社区变现机制,让团队能更高效地设计、迭代和发布网站。
Claude Opus 4.8
82Reasoning model with 1M context for agentic work
Claude Opus 4.8 是 Anthropic 推出的推理型大语言模型,拥有 100 万 token 超长上下文窗口,专为开发者和企业团队处理复杂代码、长周期智能体任务和多日工作流而设计。
NVIDIA Nemotron 3 Ultra
82The first open frontier model built for agents
NVIDIA 发布的 550B 混合专家开源大模型,专为多步骤 AI Agent 任务优化,以开源经济成本实现前沿推理能力。
Nemotron 3 Ultra by NVIDIA
82Powers faster, efficient reasoning for long-running agents
NVIDIA 发布的 550B 参数混合专家开源大模型,专为长时间运行的 AI Agent 优化,相比同类开源前沿模型推理速度提升 5 倍、成本降低 30%。
Spectron
82Agent memory you can trust
Spectron 是一个为 AI Agent 设计的统一记忆基础设施,将图数据库、向量、文档和结构化数据整合在单一 ACID 事务基底上,解决多存储拼接、数据溯源困难和记忆不可信的问题。
Fundraisly
82AI fundraising agent that finds investors and books meetings
Fundraisly 是一款 AI 融资代理工具,帮助创业者从 30 万+投资人数据库中精准匹配活跃投资人、挖掘人脉路径并自动发起冷邮件触达,目标是为每位创始人预约 20-40 场合格投资人会议。
Skippr AI
78The live AI employee inside your product, serving every user
Skippr AI 是一个嵌入式 AI 员工平台,通过实时语音、视觉和浏览器自动化操作,帮助 SaaS 产品自动完成用户引导、激活和问题解决,无需人工干预。
ZooData
78The data layer for AI agents
ZooData 将任意 URL 转化为结构化 JSON 数据,帮助 AI Agent 以更低的 token 成本获取干净的结构化数据,并提供亚马逊和 TikTok 平台的电商竞品与市场洞察能力。
Graft AI
78Turn company operations into a living map for agents
Graft AI 将企业现有的遗留系统、内部工具和屏幕操作流程转化为结构化的「操作地图」,让 AI 智能体能够稳定、安全地执行企业实际工作流,无需依赖干净的 API 接口。
River
78AI account executives that demo and close B2B deals
River 是一款 AI 销售代表产品,能够在 B2B 潜在客户询盘时立即接入通话、完成产品演示并处理异议直至成交,解决销售团队日历排期导致的线索流失问题。
Agently
78Your whole stack, running itself!
Agently 是一个企业级 AI 自动化平台,通过 100+ 连接器将 Stripe、Slack、Linear 等工具整合为统一的智能大脑,自动感知事件并端到端完成跨系统任务,无需人工干预。
ClawTeams
78The first goal-driven, proactive AI team for e-commerce
ClawTeams 是一个面向电商卖家的 AI 员工平台,用户只需设定目标,AI 团队自动分解任务、协调执行,无需微管理。
NoMac.app
78The headless iOS app publishing pipeline for AI agents.
NoMac 是一个面向 AI 代理的无头 iOS 应用发布流水线,让开发者无需 Mac 或 Xcode,直接通过 Claude、Codex 或 Cursor 等 AI 代理完成 iOS 应用的构建、签名、TestFlight 推送和 App Store 提交。
AgentKey
78One-stop live data marketplace for your agent
AgentKey 是一个一站式实时数据市场插件,让 AI Agent 通过单条命令即可接入搜索、网页、社交、金融、电商、加密货币等多类外部数据源,无需手动集成。
Osaurus
78Open source agents that run 100% locally on your Mac
Osaurus 是一个完全本地运行的 macOS 原生 AI Agent 框架,让用户无需联网即可在 Mac 上运行任意 AI 模型并实现自主任务执行,同时保护隐私数据不离开本地。
FetchSandbox
78API integration testing that remembers what breaks
FetchSandbox 是一个面向开发者和 AI Agent 的 API 集成测试工具,能够模拟 webhook、重试、异步流程和失败场景,帮助在上线前发现并复现真实 bug。
Miora
78Scale your creativity on editable canvas with agent memory
Miora 是一个具备记忆能力的 AI 创意工作室,允许用户在可编辑画布上生成多模态创意资产,并将创作风格沉淀为可复用的「技能」,让一个人拥有整个创意团队的产出能力。
Sim
78Open-source workspace for AI agents and workflows
Sim 是一个开源的 AI 智能体工作流构建平台,帮助开发者通过连接 1000+ 集成和多种 LLM 来快速搭建和编排自动化的 AI 工作流。
Timbal AI
78Build AI agents, workflows, and apps in one stack
Timbal AI 是一个一站式 AI 应用开发平台,帮助团队将 AI 原型快速落地为生产级系统,整合了 Agent 构建、工作流编排、数据连接、界面设计、部署监控与治理等全链路能力。
LongCat-2.0
781.6T MoE trained entirely on AI ASICs
LongCat-2.0 是一个开源的 1.6T 参数 MoE 大语言模型,专为编程和智能体工作流优化,支持百万级超长上下文,运行于 AI ASIC 专用硬件之上。
Katalyst
78The AI agent that works your Salesforce Pipeline
Katalyst 是一款深度集成 Salesforce 的 AI 销售智能体,自动完成通话记录整理、CRM 字段更新、跟进邮件起草及商机风险预警,帮助企业销售团队消除手动数据录入负担并提升管道管理效率。
Badge
78AI agents collect peer reviews to generate proof of work
Badge 是一款 AI 驱动的职场信任评分工具,通过自动收集同事匿名评价,为求职者生成可携带的工作证明,同时帮助招聘方在 30 秒内完成背景调查。
Octolens
78Social listening for the agent era
Octolens 是一个面向 AI 时代的社会监听 API,帮助开发者和企业将 Reddit、Hacker News、播客、新闻等互联网提及数据以结构化 JSON 形式接入 AI Agent、CRM 和数据仓库。
AnySearch
78Real-time structured search trusted by agents and developers
AnySearch 是一个专为 AI Agent 设计的实时结构化搜索工具,解决 Agent 获取信息质量低、来源杂乱的问题,提供经过过滤、去重和结构化的可信数据。
TryCase
78Disposable test environments for AI coding agents
TryCase 为 AI 编程 Agent 提供一次性 Linux 沙箱环境,让 Agent 能自主运行应用、端到端测试变更并返回已验证的代码,无需人工手动测试。
Osloq
78An AI agent that reproduces GitHub issues for you
Osloq 是一个 AI Agent,自动在真实沙箱环境中复现 GitHub Issue 中的 Bug,为开发者提供有证据支撑的复现报告,省去手动排查步骤。
Basedash Actions
78The BI tool that does, not just reports.
Basedash 是一款 AI 驱动的 BI 工具,不仅能回答数据问题,还能直接执行数据库写操作和第三方服务调用(如 Stripe、HubSpot),将数据洞察转化为可审批的自动化行动。
Needle
78The proactive GTM agent in Slack and Teams
Needle 是一个主动式 GTM AI 销售代理,嵌入 Slack/Teams,自动监控销售管道、识别停滞商机并发起跟进动作,替代人工管理 CRM 和销售流程。
Agent Mode by Receiptor AI
78Bookkeeping assistant that runs receipt workflows end-to-end
Receiptor AI 是一款基于 AI Agent 的自动化记账助手,能够端到端处理收据工作流——从收件箱和手机采集收据、整理归档到云端或会计软件,并与银行交易自动匹配,解决中小企业和个人财务管理中繁琐的收据整理问题。
BrowserAct
78Web browser automation for AI agents
BrowserAct 为 AI 智能体提供浏览器自动化层,使其能够在真实网站上执行点击、表单填写、数据提取、登录操作及绕过验证等任务。
Conduit
78Fix the tool-list bloat slowing your AI agent
Conduit 是一个本地 MCP 网关工具,通过将多个 MCP 服务器的工具列表按需路由,减少约 90% 的 token 消耗,解决 AI Agent 因工具列表膨胀导致上下文浪费的问题。
Cloudflare Temporary Accounts
78Let agents deploy before signup
Cloudflare 推出临时账户功能,允许 AI Agent 无需注册即可直接部署 Cloudflare Workers,消除自动化流程中的人工注册障碍。
AgentX
78Evaluate AI agent, pinpoint issues, and fix with one click.
AgentX 是一个面向开发者的 AI Agent 测试与可观测性平台,帮助团队在上线前发现并修复 Agent 问题,类似 AI Agent 领域的 CI/CD 工具链。
WorkClaw
78Collaborative, proactive AI coworkers who work in Slack
WorkClaw 是一款将 AI 协作者嵌入 Slack 和 Teams 的团队级智能助手平台,解决传统 AI 工具只能服务单个用户、无法融入团队协作流程的问题。
Darkmoon
78Autonomous penetration testing platform
Darkmoon 是一个自主渗透测试平台,通过 18 个专业 AI 智能体和 80+ 攻击性安全工具,覆盖 AD、Kubernetes、云基础设施等多层面,帮助安全团队自动化完成从测试到报告的完整渗透测试流程。
Unreal Engine 5.8
78Build unreal games with AI agents
Unreal Engine 5.8 是 Epic Games UE5 生命周期的最终里程碑版本,面向游戏开发者提供实验性 3D 网格地形、生产级 MegaLights 以及原生 MCP 插件支持 AI 智能体自动化开发流程。
Tine
78An AI desktop cursor that does the work for you
Tine 是一个运行在 Mac 刘海区的 AI 第二光标,能感知屏幕上下文并直接跨应用操作,无需切换窗口或手动粘贴,实现真正的端到端任务自动化。
Agentic videos by D-ID
78Interactive videos that talk back
D-ID 的 Agentic Videos 将普通视频转化为可交互的 AI 体验,观众可在视频中实时提问并获得 AI 驱动的虚拟主播回答,实现个性化内容消费。
Elvin
78Proactive AI that finds and finishes work before you ask
Elvin 是一款主动式 AI 工作助手,自动跨工具发现并处理协调类任务,将消息、会议、文档等散落信息转化为可审批的草稿和后续行动,解决用户充当 AI 与实际工作之间「路由层」的低效问题。
Locus Founder
78Text an AI agent and it builds + runs your business
Locus Founder 是一个 AI 驱动的全自动创业代理,通过短信交互即可帮用户从零搭建并持续运营一个完整的在线业务,涵盖品牌设计、全栈开发、支付集成、供应链和广告投放。
Novu Connect
78Ship agents where your users already work
Novu Connect 是一个面向开发者的 AI Agent 多渠道通信基础设施,让 AI Agent 无需自建集成即可通过 Slack、Teams、WhatsApp、Telegram、邮件等渠道与用户进行双向对话。
Kimi K2.7 Code
78Kimi’s most capable coding model yet
Kimi K2.7 Code 是 Moonshot AI 推出的最新编程专用 Agent 模型,支持 256K 超长上下文与多模态输入,主打长链路软件工程任务,推理 token 消耗比上代降低约 30%。
Asmi AI
78AI that handles your personal chores in the real world
Asmi 是一个 AI 语音助理,每天早晨主动致电用户了解待办事项,然后代替用户拨打电话处理日常杂务(预约、沟通、等待接听),并通过 iMessage 或 WhatsApp 汇报结果。
Cignara
78AI Agents for Fortune 500 grade customer support
Cignara 为企业提供具备严格策略治理的 AI 客服代理,支持语音与文字全渠道对话,主打零幻觉、可验证的客户服务自动化。
Devin Desktop
78Manage fleets of local and cloud agents from one surface
Devin Desktop 是一款面向开发者的 AI 代理管理桌面工具,允许用户在编辑器内统一管理本地与云端 AI 编码代理,实现任务规划、委派、审查和交付的全流程闭环。
Brief
78Navigate your agents to product-market fit
Brief 是一个为产品团队打造的「活体知识库」,将产品决策、战略意图和执行上下文统一管理,并通过 Chat、Slack、CLI 和 MCP 接口向人类成员和 AI 智能体实时提供相关上下文,防止 AI 在开发过程中「失去方向」。
Vokal
78A collaboration space for 10x teammates with their Al agents
Vokal 是一个多人 AI 协作空间,让团队成员和各自的 AI 编程代理(如 Codex、Claude Code)在同一个工作区实时协作,解决跨 AI 代理无法直接通信、需要人工中转的效率痛点。
Rex
74AI agents that run order-to-cash operations
Rex 为全球企业构建 AI 驱动的订单到现金(Order-to-Cash)自动化工作团队,通过智能 Agent 覆盖每个账户并在资金卡滞前主动处理异常。
Agentcard for companies
74Give your agent a debit card
为 AI Agent 提供一次性虚拟借记卡,允许开发者从钱包中划拨固定预算,让 Agent 能够自主完成在线支付,解决 AI 自动化流程中的支付授权与预算控制问题。
Pazi
74Vibe code business operations
Pazi 是一个 AI 智能体团队平台,帮助个人创业者将想法(书籍、店铺、应用、技能变现)快速落地,自动完成建站、外联、内容创作等业务运营任务。
AI Agent · KOL 观点
Andrej Karpathy 提出了一套完整的 AI 工程方法论,核心是将上下文窗口视为代码(Software 3.0),用工程化思维(规范设计、差异审查、评估循环)替代随意的 Prompt 尝试。他还推广了并行 Agent 管理模式和 CLAUDE.md 配置文件,构建出一套从世界观到具体工具的完整实践体系。
Anthropic的Claude Code创始人Boris Cherny披露,他已8个月未亲手写过一行代码,完全依靠管理数千个AI Agent完成软件开发工作。截至2026年5月,超过80%合并进Anthropic代码库的代码由Claude自主撰写,代码产出量较年初增长8倍。更值得关注的是,该系统已开始自主浏览GitHub和X寻找下一步构建方向,递归自我改进正在成为现实。
Anthropic 公开了其内部 AI 辅助编程的规模化数据:截至2026年5月,Claude 已负责超过80%的生产代码提交,工程师人均代码产出提升8倍,开放性任务成功率达76%(半年内提升50个百分点)。这是业界首份来自前沿实验室的、基于真实生产环境的 Agentic 编程规模化原始数据报告,而非基准测试或演示。文章提炼了可供工程团队直接参考的工作流模式,如 maker-checker 循环等。
Andrej Karpathy 展示了 AI 自主科研的早期实践:他用约30行代码构建了一个自动化研究智能体 AutoResearch,能够在无人干预的情况下循环执行假设-实验-验证流程,两天内发现约20项互补优化,将训练速度提升11%。这标志着 AI 从执行指令向复现科学方法的跨越,Karpathy 本人也于2026年5月加入 Anthropic 将此方法规模化应用于 Claude 的研究。
Andrej Karpathy 发布了开源项目 autoresearch,一个仅 630 行 Python 代码的自主 AI 研究框架,能在无人干预的情况下一夜完成上百次实验迭代。其核心创新在于让 AI agent 直接修改训练代码而非调参,实现了开放式架构探索。实测结果显示,该系统在 Karpathy 已优化的代码基础上再提速 11%,并发现了人类研究者遗漏的 bug。
Karpathy 提出的「循环工程」范式用持续自动化循环替代单次提示,核心是验证器+状态文件+停止条件三件套。其 AutoResearch 项目在2天内运行约700次实验,发现了人工遗漏的改进;Bilevel Autoresearch 在此基础上叠加元循环,同等基准上报告了5倍的收益。
Building Startups for Agents, a 10-Year Opportunity | Greg Isenberg posted on the topic | LinkedIn
88Greg Isenberg认为未来10年最大的创业机会是专为AI Agent构建的基础设施和服务层。他列举了19个具体方向,核心逻辑是:Agent在消费、权限、安全、法律、支付等维度的行为模式与人类截然不同,现有工具无法满足,催生出全新的垂直市场。这与移动互联网时代围绕智能手机建立基础设施的历史路径高度相似。
Karpathy警告AI行业,当前Agent热潮存在重蹈OpenAI五年弯路的风险。其核心论点是:Agent能力的天花板取决于底层基础模型的质量,在基础模型尚未成熟时强推Agent只会导致失败。Anthropic和OpenAI在AI4S领域的最新布局,恰好印证了这一判断——两者都在用工作流和生态整合来弥补基础模型的结构性不足。
Karpathy在YC AI创业学校演讲中提出「软件3.0」框架,将LLM类比为操作系统而非商品,强调提示词已成为新的编程语言。他指出AI自动化需满足感知、行动、监督三个前提,并警告从演示到成熟产品之间存在巨大鸿沟,认为这是「代理人的十年」而非一年。
Greg Isenberg 提出 AI Agent 是新一代 SaaS 浪潮,核心转变是从「卖软件工具」变为「卖已完成的工作」。他给出了一套完整的 7 步落地方法,包括选定细分领域、人工影随、构建最小可用 Agent,以及以劳动力而非软件的方式定价销售。该框架对于想切入 Agent 创业的人具有极高的操作参考价值。
Karpathy提出将笔记视为不可变'源代码'、以LLM为'编译器'构建结构化个人知识库的新范式,用三层架构(原始层/模式层/Wiki层)取代传统RAG的碎片化检索。该框架通过Ingest、Query、Lint三类操作自动维护知识一致性,解决了个人知识管理长期存在的维护成本过高问题,被视为继Vibe Coding和Agentic Engineering之后人机协作的第三个重要范式。
Greg Isenberg 提出「AI Agent 即新 SaaS」的核心论点:软件正从辅助工作转变为直接完成工作,创业者应将某个具体岗位的工作流打包成服务出售,定价逻辑对标劳动力而非软件授权。他给出了一套完整打法:锁定带薪工作流、深度跟岗观察、构建最小可用 Agent、以试点形式销售,再逐步产品化。文章以 Slang AI、Same Day 为真实案例,并附 30 天从零启动计划。
Claude Code凭借软件领域独有的可验证奖励机制(编译器+测试套件)实现了强化学习的突破,成为史上最快达到十亿美元年化营收的软件产品。文章核心论点是:代码之所以率先被AI攻克,不是因为编程简单,而是因为它是极少数拥有客观评分函数的知识工作领域。这一结构性优势正在向其他行业蔓延,关键在于谁能为下一个领域构建'答案钥匙'。
本文系统介绍了 Andrej Karpathy 提出的 LLM Agent 记忆四分类框架:权重内记忆、上下文记忆、外部检索记忆和 KV 缓存记忆,并结合 Python 代码讲解每种记忆的实现方式。文章兼具理论深度与工程实用性,是构建 AI Agent 记忆系统的高质量参考指南。
AI购物代理(如ChatGPT、Perplexity)正在真实下单,Adobe数据显示AI来源流量在2026年Q1同比增长393%,转化率比自然流量高42%。文章提供了一份六大支柱自评清单(产品数据流、结构化数据、协议集成、机器可读政策、信任信号、AI引用),帮助商家诊断自身对AI代理的可见性与可交易性。当前仅3%的交易通过AI代理完成,但72%的商家承认消费者接受速度将超过自身准备速度,窗口期正在关闭。
Anthropic Claude Code负责人Boris Cherny在Meta @Scale大会上提出,AI编码正进入第三阶段:由Agent互相调用Agent来完成代码编写,形成持续运行的递归循环结构。这种'loop'模式颠覆了传统的'启动-检查-停止'工作流,子Agent会持续在后台监控代码库、提交PR,直到收到终止信号,Cherny本人已在日常开发中运行此类持久化子Agent。
Claude Code 的创始人 Boris Cherny 在一个月内提交了 259 个 PR、却未手写一行代码后,彻底卸载了 IDE,转向「循环工程」(Loop Engineering)范式——即构建能自动发现任务、调度执行、判断完成并决定下一步的小型系统。文章详细拆解了循环的三层「蜂巢」架构(本地循环层、云端例程层、集群并行层)和六大核心组件,并指出这一范式并非全新技术,而是 ReAct、AutoGPT 等已有思路的系统化落地。
Claude Code创始人Boris Cherny已完全转向自动化Agent工作流,不再手动编写提示词或使用IDE。他通过三层架构(/loop、Routines、动态工作流)实现白天5-10个交互式Agent、夜间数千个并行Agent的规模化运作,核心是让Claude自主编排任务、执行并自我验证结果。文章提供了完整的可复用模板,包括斜杠命令文件、cron表达式和800-Agent并行工作流代码。
"Claude Code is writing all the code": Anthropic's output is up 8x, creator says - video Dailymotion
88Anthropic的Claude Code负责人Boris Cherny表示,自年初以来Anthropic的代码产出提升了8倍,且他本人已8个月未手写过一行代码。代码审查已成为新瓶颈,Anthropic通过多个具备不同视角的Claude agent协作进行代码审查来应对。更值得关注的是,Claude Code正逐步具备自主提出功能想法的能力,能主动扫描GitHub、Twitter、Slack后生成经过验证的PR。
Greg Isenberg 与联合创始人 Theo Taba 系统讲解了如何构建 AI 原生组织,核心是让人管理自主 Agent、Agent 读写公司知识库,并通过「技能链」替代单一提示词来大幅提升输出质量。现场演示了 5 分钟内生成客户提案微站、10 分钟内搭建功能原型,证明该方法论具备直接落地价值。
Karpathy通过'幽灵'隐喻解释了LLM的本质局限:它们不是从世界中成长的动物,而是从文本库中召唤出的统计幽灵,缺乏真实的情境世界模型。文章以此为基础,构建了Spec、Verifier、Environment三层Agentic AI框架,试图弥补这一根本性缺陷。核心洞察是:LLM的幻觉、锯齿状智能、失忆和易受骗性,都源于它对情境的根本性缺失。
Claude Code 创始人 Boris Cherny 描述了他编程方式的最新演变:从使用 IDE 到提示 Claude,再到如今编写自动化循环让系统自主与 Claude 交互、评估输出并迭代。他认为这代表了软件开发的下一层抽象,人类角色从执行者转变为编排者,预计这一转变将在未来数月内成为主流。
Claude Code 的创造者 Boris Cherny 认为,随着 AI 编程能力的成熟,'软件工程师'这一职位将逐渐消失,取而代之的是'构建者'(Builder)——一种以 AI 为中心、以判断力和目标感驱动的工作角色。黑客马拉松的结果表明,非技术背景的人(电工、医生、木匠)借助 AI 代理反而胜过专业工程师,说明真正稀缺的能力是'知道自己要构建什么'。他以1990年代企业采用个人电脑的历史为鉴,强调只有将 AI 置于工作流核心的组织才能获得真正的生产力提升。
Salesforce 使用 Claude Code Agents 将原本需要 231 天的代码迁移任务压缩至 13 天完成,同期 PR 数量上升但系统故障率反降 5%。这打破了'效率与质量不可兼得'的传统认知,核心在于将安全护栏和质量标准直接内嵌于 Agent 工作流中。作者强调,AI 真正的价值不在于加速现有流程,而在于重构工作方式、消除不必要的环节和交接。
Claude Code创始人Boris Cherny分享了AI编程工具如何重塑软件工程的核心洞察:工程师角色已从写代码转向编排AI工作流,Anthropic内部人均生产力提升200%,新工程师上手时间从数周缩短至两天。他预言通才工程师的黄金时代已到来,甚至对'品味'这一被认为是人类持久优势的东西提出了质疑。
Andrej Karpathy 在 Sequoia AI Ascent 2026 上提出「Agentic Engineering」概念,认为这是继 Vibe Coding 之后更具工程纪律的 AI 编程范式。他将 2025 年 12 月定义为 AI 编程能力的关键拐点,并以 Software 3.0(prompt 即编程)框架描述大模型作为解释器、上下文窗口作为核心杠杆的新开发方式。
Karpathy 在 Sequoia Ascent 2026 上提出 Software 3.0 框架:LLM 是解释器,上下文窗口就是程序本身,提示词/工具/记忆取代了传统代码。这不是现有开发流程的加速,而是一种范式跃迁——许多原本需要完整应用架构才能解决的问题,现在一个提示词即可完成。对 AI 创业者的核心追问是:哪些软件根本不应该继续以软件形态存在?
Karpathy 在 Sequoia Ascent 演讲中提出 Software 3.0 的概念框架,将 LLM 定义为继显式代码(1.0)和训练权重(2.0)之后的第三个可编程层,核心组成为提示词、智能体、工具、记忆与验证。他将 2025 年 12 月标记为 AI 智能体从演示走向实际生产的拐点。其核心判断是:下一代 AI 原生公司的竞争壁垒不在于 UI 封装,而在于谁拥有最强的验证闭环。
Andrej Karpathy 于2026年3月发布了一个约30行代码的AI自动化研究原型,让智能体自主编辑训练代码、运行实验并迭代优化,两天内完成700次实验,将GPT-2训练时间缩短11%。随后他加入Anthropic,将这一循环引入Claude的预训练流程,目标是用AI替代人工ML研究者加速训练优化的发现过程。