Andrej Karpathy 提出了一套完整的 AI 工程方法论,核心是将上下文窗口视为代码(Software 3.0),用工程化思维(规范设计、差异审查、评估循环)替代随意的 Prompt 尝试。他还推广了并行 Agent 管理模式和 CLAUDE.md 配置文件,构建出一套从世界观到具体工具的完整实践体系。
AI 编程
AI 辅助编程、代码生成、Vibe Coding、Copilot 类工具与最佳实践
AI 编程 · 精选产品
Claude Fable 5
91Anthropic's most capable model ever — free until June 22
Anthropic 推出的最强 AI 模型 Claude Fable 5,在代码、科学、视觉等多领域刷新 SOTA 基准,面向开发者和企业用户提供极致推理与自动化能力。
GPT-5.6
88A new standard for intelligence and efficiency
OpenAI 发布 GPT-5.6 模型家族,提供旗舰版(Sol)、均衡版(Terra)和轻量版(Luna)三档选择,面向开发者推出程序化工具调用、多智能体并行执行及显式提示缓存等新能力。
Glaze by Raycast
85Create your own Mac apps by chatting with AI
Glaze 是 Raycast 团队推出的 Mac 端 AI 应用生成工具,用户通过自然语言描述即可生成能离线运行、驻留 Dock 的真实 Mac 原生应用,让软件真正个人化。
Clark
82An AI coworker with its own cloud computer
Clark 是一个拥有独立云端计算机(浏览器、终端、文件、代码环境)的 AI 协作员,用户可以将复杂任务完整交给它异步完成,涵盖研究、代码、文档等多种交付物。
Kimi K3
82The world's first open 3T-class model
Kimi K3 是月之暗面推出的全球首个开源 3T 参数级大模型,具备原生视觉能力和百万 token 上下文窗口,面向代码生成、科学推理等高难度任务场景。
Kimi K3
82The world's first open 3T-class model
Kimi K3 是全球首个开源的3万亿参数级大模型,覆盖编程、知识工作和推理任务,支持原生多模态与100万上下文窗口。
Kimi K3
82Open frontier intelligence: 2.8T params, 1M-token context
Kimi K3 是月之暗面发布的 2.8T 参数开源大语言模型,支持百万 token 上下文窗口和原生视觉能力,面向代码、知识工作和复杂推理场景。
Coasty
82A Computer-Use-Agent that runs legacy software like a human
Coasty 是一个计算机操控 AI 代理,能像人类一样自主操作桌面软件(无需 API),主要解决医疗、保险、税务等行业中遗留系统自动化难题。
GPT-Live
82Full-duplex voice for ChatGPT
GPT-Live 是 OpenAI 为 ChatGPT 推出的全双工语音模型,支持同步听说、自然处理停顿与打断,解决了传统语音助手交互不自然、延迟高的问题。
Context.dev
82One API to scrape, enrich, and extract the internet
Context.dev 是一个面向 AI 产品和 Agent 的 Web 上下文 API,通过单一接口提供网页抓取、结构化数据提取、Markdown 转换、截图及公司品牌信息等能力,帮助开发者快速为 AI 应用注入互联网数据。
Sequence Agentic
82Money movement for AI agents
Sequence 是面向 AI Agent 的金融执行层,允许 AI 代理通过 API 真实地发送、拆分和路由资金,同时通过权限隔离、服务端限额和审计日志确保安全可控。
Claude Sonnet 5
82AI that plans, acts, and gets work done
Anthropic 推出的最新 Claude Sonnet 5 模型,专注于 Agentic AI 能力,能够自主规划、执行任务,适用于编程和日常专业工作场景。
Tabstack Browser Automation
82Automate the web in your app or agent, no browser to host
Tabstack 是 Mozilla 推出的浏览器自动化 API,开发者只需一句自然语言即可驱动真实浏览器完成网页操作,无需自行托管浏览器或配置框架。
v0 Design Systems 2.0
82Build with your components, colors, fonts, and patterns
v0 Design Systems 2.0 允许开发者和设计师将现有设计系统(GitHub、npm、Figma、Storybook 等来源)导入 v0,自动学习组件用法并生成可交互的 AI 编码 playground,解决 AI 生成代码与团队设计规范脱节的问题。
Cursor for iOS
82Build with coding agents from anywhere
Cursor 推出 iOS 原生应用,让开发者可以随时随地通过手机启动云端 AI 编程 Agent、监控任务进度并合并 PR,打破本地机器的时空限制。
Skybridge
82The full-stack open source React framework for MCP Apps
Skybridge 是一个开源的全栈 React 框架,专为构建运行在 AI 助手(如 ChatGPT、Claude)内部的 MCP 应用而设计,解决了 MCP 应用开发工具链缺失的问题。
Claude Opus 4.8
82Reasoning model with 1M context for agentic work
Claude Opus 4.8 是 Anthropic 推出的推理型大语言模型,拥有 100 万 token 超长上下文窗口,专为开发者和企业团队处理复杂代码、长周期智能体任务和多日工作流而设计。
NVIDIA Nemotron 3 Ultra
82The first open frontier model built for agents
NVIDIA 发布的 550B 混合专家开源大模型,专为多步骤 AI Agent 任务优化,以开源经济成本实现前沿推理能力。
Nemotron 3 Ultra by NVIDIA
82Powers faster, efficient reasoning for long-running agents
NVIDIA 发布的 550B 参数混合专家开源大模型,专为长时间运行的 AI Agent 优化,相比同类开源前沿模型推理速度提升 5 倍、成本降低 30%。
Spectron
82Agent memory you can trust
Spectron 是一个为 AI Agent 设计的统一记忆基础设施,将图数据库、向量、文档和结构化数据整合在单一 ACID 事务基底上,解决多存储拼接、数据溯源困难和记忆不可信的问题。
Inkling
78Open weights 975B multimodal model built for fine-tuning
Inkling 是 Thinking Machines 发布的首个开源权重多模态大模型(975B MoE),支持文本、图像和音频的原生推理,开发者可直接下载或在 Tinker 平台上进行微调。
Replay QA
78Replay QA tells you what is broken before your users do
Replay QA 是一款面向开发者的 AI 自动化测试工具,能在用户发现 bug 之前主动探索应用、录制会话并定位根因,帮助团队更快修复问题。
ZooData
78The data layer for AI agents
ZooData 将任意 URL 转化为结构化 JSON 数据,帮助 AI Agent 以更低的 token 成本获取干净的结构化数据,并提供亚马逊和 TikTok 平台的电商竞品与市场洞察能力。
Unabyss for Claude
78Shared memory across all apps and LLMs. In Claude
Unabyss 是一个跨 AI 工具的共享记忆层,让 Claude、GPT、Cursor 等不同 AI 助手能共享同一份用户上下文,解决各 AI 工具「各自为战、互不知情」的碎片化问题。
SonOf
78Empty your backlog. Pay only when it ships
SonOf 是一个 AI 驱动的自动化工程服务,连接代码仓库和项目管理工具,自动审计代码库、编写并估算工单、完成开发任务,仅在代码成功上线时收费,帮助团队清空积压需求。
Graft AI
78Turn company operations into a living map for agents
Graft AI 将企业现有的遗留系统、内部工具和屏幕操作流程转化为结构化的「操作地图」,让 AI 智能体能够稳定、安全地执行企业实际工作流,无需依赖干净的 API 接口。
NoMac.app
78The headless iOS app publishing pipeline for AI agents.
NoMac 是一个面向 AI 代理的无头 iOS 应用发布流水线,让开发者无需 Mac 或 Xcode,直接通过 Claude、Codex 或 Cursor 等 AI 代理完成 iOS 应用的构建、签名、TestFlight 推送和 App Store 提交。
AgentKey
78One-stop live data marketplace for your agent
AgentKey 是一个一站式实时数据市场插件,让 AI Agent 通过单条命令即可接入搜索、网页、社交、金融、电商、加密货币等多类外部数据源,无需手动集成。
Osaurus
78Open source agents that run 100% locally on your Mac
Osaurus 是一个完全本地运行的 macOS 原生 AI Agent 框架,让用户无需联网即可在 Mac 上运行任意 AI 模型并实现自主任务执行,同时保护隐私数据不离开本地。
Second Brain for AI v2
78AI memory that connects the dots across every tool
Second Brain for AI v2 是一个开源、自托管的 AI 记忆层,帮助用户在 Claude、ChatGPT、Cursor 等多个 AI 工具之间持久化并智能关联项目、决策和偏好信息,解决跨工具上下文割裂的问题。
FetchSandbox
78API integration testing that remembers what breaks
FetchSandbox 是一个面向开发者和 AI Agent 的 API 集成测试工具,能够模拟 webhook、重试、异步流程和失败场景,帮助在上线前发现并复现真实 bug。
Effects SDK
78AI video & audio effects SDK for real-time apps
Effects SDK 为开发者提供客户端运行的 AI 视频与音频效果 SDK,无需将数据上传至服务器即可实现背景虚化、虚拟背景、智能取景、降噪等实时效果。
Sim
78Open-source workspace for AI agents and workflows
Sim 是一个开源的 AI 智能体工作流构建平台,帮助开发者通过连接 1000+ 集成和多种 LLM 来快速搭建和编排自动化的 AI 工作流。
PlugThis
78Create your own Chrome Extensions by chatting with AI
PlugThis 是一个专注于 Chrome 扩展生成的 AI 构建工具,用户用自然语言描述需求即可自动生成可发布的扩展程序,解决了「想要的扩展不存在、自己又不会开发」的痛点。
Auriko
78Trading desk for LLM calls
Auriko 是一个面向开发者的 LLM 调用智能路由平台,通过类量化交易的套利引擎,在多个 AI 推理服务商之间自动选择最优路径,平均降低 30% 的 API 调用成本。
Timbal AI
78Build AI agents, workflows, and apps in one stack
Timbal AI 是一个一站式 AI 应用开发平台,帮助团队将 AI 原型快速落地为生产级系统,整合了 Agent 构建、工作流编排、数据连接、界面设计、部署监控与治理等全链路能力。
Universal-3.5 Pro
78Native code switching, better diarization, more languages.
AssemblyAI 推出的新一代语音转文字模型,支持18种语言无缝切换、高精度说话人分离,面向开发者提供实时与异步两种API接入方式。
LongCat-2.0
781.6T MoE trained entirely on AI ASICs
LongCat-2.0 是一个开源的 1.6T 参数 MoE 大语言模型,专为编程和智能体工作流优化,支持百万级超长上下文,运行于 AI ASIC 专用硬件之上。
Octolens
78Social listening for the agent era
Octolens 是一个面向 AI 时代的社会监听 API,帮助开发者和企业将 Reddit、Hacker News、播客、新闻等互联网提及数据以结构化 JSON 形式接入 AI Agent、CRM 和数据仓库。
AnySearch
78Real-time structured search trusted by agents and developers
AnySearch 是一个专为 AI Agent 设计的实时结构化搜索工具,解决 Agent 获取信息质量低、来源杂乱的问题,提供经过过滤、去重和结构化的可信数据。
TryCase
78Disposable test environments for AI coding agents
TryCase 为 AI 编程 Agent 提供一次性 Linux 沙箱环境,让 Agent 能自主运行应用、端到端测试变更并返回已验证的代码,无需人工手动测试。
Osloq
78An AI agent that reproduces GitHub issues for you
Osloq 是一个 AI Agent,自动在真实沙箱环境中复现 GitHub Issue 中的 Bug,为开发者提供有证据支撑的复现报告,省去手动排查步骤。
Basedash Actions
78The BI tool that does, not just reports.
Basedash 是一款 AI 驱动的 BI 工具,不仅能回答数据问题,还能直接执行数据库写操作和第三方服务调用(如 Stripe、HubSpot),将数据洞察转化为可审批的自动化行动。
Stigg 2.0
78The usage runtime for AI products
Stigg 2.0 是一个面向 AI 产品的用量运行时层,在请求路径中实时执行计费、权限与治理逻辑,彻底取代事后对账模式。
Gemini Omni Flash
78High-quality video generation and conversational editing
Google 推出的 Gemini Omni Flash 是一款面向开发者的多模态视频生成模型,支持通过文本、图像和视频输入进行高质量视频生成与对话式编辑。
Adam CAD Copilot
78AI CAD inside Onshape and Fusion
Adam 是一款嵌入 Onshape 和 Autodesk Fusion 的 AI CAD 助手,让机械工程师通过自然语言提示创建和编辑零件,无需离开现有工作流。
BrowserAct
78Web browser automation for AI agents
BrowserAct 为 AI 智能体提供浏览器自动化层,使其能够在真实网站上执行点击、表单填写、数据提取、登录操作及绕过验证等任务。
Conduit
78Fix the tool-list bloat slowing your AI agent
Conduit 是一个本地 MCP 网关工具,通过将多个 MCP 服务器的工具列表按需路由,减少约 90% 的 token 消耗,解决 AI Agent 因工具列表膨胀导致上下文浪费的问题。
Cloudflare Temporary Accounts
78Let agents deploy before signup
Cloudflare 推出临时账户功能,允许 AI Agent 无需注册即可直接部署 Cloudflare Workers,消除自动化流程中的人工注册障碍。
AgentX
78Evaluate AI agent, pinpoint issues, and fix with one click.
AgentX 是一个面向开发者的 AI Agent 测试与可观测性平台,帮助团队在上线前发现并修复 Agent 问题,类似 AI Agent 领域的 CI/CD 工具链。
Darkmoon
78Autonomous penetration testing platform
Darkmoon 是一个自主渗透测试平台,通过 18 个专业 AI 智能体和 80+ 攻击性安全工具,覆盖 AD、Kubernetes、云基础设施等多层面,帮助安全团队自动化完成从测试到报告的完整渗透测试流程。
Unreal Engine 5.8
78Build unreal games with AI agents
Unreal Engine 5.8 是 Epic Games UE5 生命周期的最终里程碑版本,面向游戏开发者提供实验性 3D 网格地形、生产级 MegaLights 以及原生 MCP 插件支持 AI 智能体自动化开发流程。
Novu Connect
78Ship agents where your users already work
Novu Connect 是一个面向开发者的 AI Agent 多渠道通信基础设施,让 AI Agent 无需自建集成即可通过 Slack、Teams、WhatsApp、Telegram、邮件等渠道与用户进行双向对话。
Kimi K2.7 Code
78Kimi’s most capable coding model yet
Kimi K2.7 Code 是 Moonshot AI 推出的最新编程专用 Agent 模型,支持 256K 超长上下文与多模态输入,主打长链路软件工程任务,推理 token 消耗比上代降低约 30%。
Respan Gateway
78One AI gateway with built-in observability and evals
Respan Gateway 是一个 AI 统一网关平台,通过单一接入点连接 1000+ AI 模型,并内置可观测性、评估、成本控制等能力,解决生产环境中 AI 应用可靠性与多工具碎片化管理的问题。
Claude Fable 5: a Mythos-class1 model
78Anthropic's most capable model, now available to everyone
Claude Fable 5 是 Anthropic 推出的首个 Mythos 级公开大语言模型,通过智能安全路由机制在保持高能力的同时处理风险查询,面向开发者和企业提供强大的代码迁移与 AI 推理能力。
TypingMind
78Pay per use, no subscription, 18 model providers supported
TypingMind 是一个聚合 18 家 AI 模型提供商的统一工作台,用户用自己的 API Key 按量付费,无需为多个订阅单独付费。
Cleo Atlas Legal API
78The world's regulations, machine-readable.
Cleo Atlas 将全球177个司法管辖区的25.6万条法规转化为机器可读的API,帮助企业快速查询和合规管理跨境监管要求。
Microsoft MAI-Voice-2
78Expressive TTS with voice cloning in 15 languages
微软推出的高表现力语音合成模型,支持短样本声音克隆与15种语言情感控制,面向生产级语音智能体开发者。
Veltrix AI
78AI finance copilot for cash flow, margins, and growth
Veltrix AI 是一款面向创始人和财务团队的 AI 财务副驾驶,通过连接 QuickBooks、Xero、Shopify 等主流工具,支持用自然语言查询现金流、利润率和业务表现,替代繁琐的电子表格和静态仪表盘。
AI 编程 · KOL 观点
Anthropic的Claude Code创始人Boris Cherny披露,他已8个月未亲手写过一行代码,完全依靠管理数千个AI Agent完成软件开发工作。截至2026年5月,超过80%合并进Anthropic代码库的代码由Claude自主撰写,代码产出量较年初增长8倍。更值得关注的是,该系统已开始自主浏览GitHub和X寻找下一步构建方向,递归自我改进正在成为现实。
Anthropic 公开了其内部 AI 辅助编程的规模化数据:截至2026年5月,Claude 已负责超过80%的生产代码提交,工程师人均代码产出提升8倍,开放性任务成功率达76%(半年内提升50个百分点)。这是业界首份来自前沿实验室的、基于真实生产环境的 Agentic 编程规模化原始数据报告,而非基准测试或演示。文章提炼了可供工程团队直接参考的工作流模式,如 maker-checker 循环等。
Andrej Karpathy 展示了 AI 自主科研的早期实践:他用约30行代码构建了一个自动化研究智能体 AutoResearch,能够在无人干预的情况下循环执行假设-实验-验证流程,两天内发现约20项互补优化,将训练速度提升11%。这标志着 AI 从执行指令向复现科学方法的跨越,Karpathy 本人也于2026年5月加入 Anthropic 将此方法规模化应用于 Claude 的研究。
Andrej Karpathy 发布了开源项目 autoresearch,一个仅 630 行 Python 代码的自主 AI 研究框架,能在无人干预的情况下一夜完成上百次实验迭代。其核心创新在于让 AI agent 直接修改训练代码而非调参,实现了开放式架构探索。实测结果显示,该系统在 Karpathy 已优化的代码基础上再提速 11%,并发现了人类研究者遗漏的 bug。
Andrej Karpathy 记录了自己在2025年底几周内工作流从80%手写代码转变为80%由AI生成代码的亲身经历,提出「英语是最热门的新编程语言」。他不仅分析了AI编码的局限性(过度假设、代码臃肿、不主动澄清歧义),更指出AI真正的魔法在于「韧性」——能在闭环中不知疲倦地反复尝试直至达成目标,这正是大多数AGI体感的来源。他建议开发者从命令式思维转向声明式思维,给AI明确的成功标准而非逐步指令。
Karpathy在YC AI创业学校演讲中提出「软件3.0」框架,将LLM类比为操作系统而非商品,强调提示词已成为新的编程语言。他指出AI自动化需满足感知、行动、监督三个前提,并警告从演示到成熟产品之间存在巨大鸿沟,认为这是「代理人的十年」而非一年。
Karpathy提出将笔记视为不可变'源代码'、以LLM为'编译器'构建结构化个人知识库的新范式,用三层架构(原始层/模式层/Wiki层)取代传统RAG的碎片化检索。该框架通过Ingest、Query、Lint三类操作自动维护知识一致性,解决了个人知识管理长期存在的维护成本过高问题,被视为继Vibe Coding和Agentic Engineering之后人机协作的第三个重要范式。
Claude Code凭借软件领域独有的可验证奖励机制(编译器+测试套件)实现了强化学习的突破,成为史上最快达到十亿美元年化营收的软件产品。文章核心论点是:代码之所以率先被AI攻克,不是因为编程简单,而是因为它是极少数拥有客观评分函数的知识工作领域。这一结构性优势正在向其他行业蔓延,关键在于谁能为下一个领域构建'答案钥匙'。
本文系统介绍了 Andrej Karpathy 提出的 LLM Agent 记忆四分类框架:权重内记忆、上下文记忆、外部检索记忆和 KV 缓存记忆,并结合 Python 代码讲解每种记忆的实现方式。文章兼具理论深度与工程实用性,是构建 AI Agent 记忆系统的高质量参考指南。
Anthropic Claude Code负责人Boris Cherny在Meta @Scale大会上提出,AI编码正进入第三阶段:由Agent互相调用Agent来完成代码编写,形成持续运行的递归循环结构。这种'loop'模式颠覆了传统的'启动-检查-停止'工作流,子Agent会持续在后台监控代码库、提交PR,直到收到终止信号,Cherny本人已在日常开发中运行此类持久化子Agent。
Claude Code 的创始人 Boris Cherny 在一个月内提交了 259 个 PR、却未手写一行代码后,彻底卸载了 IDE,转向「循环工程」(Loop Engineering)范式——即构建能自动发现任务、调度执行、判断完成并决定下一步的小型系统。文章详细拆解了循环的三层「蜂巢」架构(本地循环层、云端例程层、集群并行层)和六大核心组件,并指出这一范式并非全新技术,而是 ReAct、AutoGPT 等已有思路的系统化落地。
Andrej Karpathy 在 AI 创业学校的主题演讲中提出「Software 3.0」概念,认为自然语言正成为新的编程接口,LLM 是一种新型计算机。这一范式转变不仅改变了开发者的工具链,更重新定义了软件本身的构建方式。对开发者、用户和产品设计均有深远影响。
Claude Code创始人Boris Cherny已完全转向自动化Agent工作流,不再手动编写提示词或使用IDE。他通过三层架构(/loop、Routines、动态工作流)实现白天5-10个交互式Agent、夜间数千个并行Agent的规模化运作,核心是让Claude自主编排任务、执行并自我验证结果。文章提供了完整的可复用模板,包括斜杠命令文件、cron表达式和800-Agent并行工作流代码。
"Claude Code is writing all the code": Anthropic's output is up 8x, creator says - video Dailymotion
88Anthropic的Claude Code负责人Boris Cherny表示,自年初以来Anthropic的代码产出提升了8倍,且他本人已8个月未手写过一行代码。代码审查已成为新瓶颈,Anthropic通过多个具备不同视角的Claude agent协作进行代码审查来应对。更值得关注的是,Claude Code正逐步具备自主提出功能想法的能力,能主动扫描GitHub、Twitter、Slack后生成经过验证的PR。
nanochat 2026: Andrej Karpathy's Open-Source "ChatGPT for $100" — Full LLM Pipeline in 8,000 Lines
88Andrej Karpathy 于2025年10月发布 nanochat,一个约8000行 Python+Rust 代码的完整 LLM 训练流水线,涵盖从分词器到推理服务的全链路。其核心主张是用约100美元云GPU费用即可训练出具备真实对话能力的 GPT-2 级别模型,截至2026年6月已获54700个 GitHub Star,成为开源社区最受关注的 LLM 训练教程。
Claude Code 创始人 Boris Cherny 描述了他编程方式的最新演变:从使用 IDE 到提示 Claude,再到如今编写自动化循环让系统自主与 Claude 交互、评估输出并迭代。他认为这代表了软件开发的下一层抽象,人类角色从执行者转变为编排者,预计这一转变将在未来数月内成为主流。
Claude Code 的创造者 Boris Cherny 认为,随着 AI 编程能力的成熟,'软件工程师'这一职位将逐渐消失,取而代之的是'构建者'(Builder)——一种以 AI 为中心、以判断力和目标感驱动的工作角色。黑客马拉松的结果表明,非技术背景的人(电工、医生、木匠)借助 AI 代理反而胜过专业工程师,说明真正稀缺的能力是'知道自己要构建什么'。他以1990年代企业采用个人电脑的历史为鉴,强调只有将 AI 置于工作流核心的组织才能获得真正的生产力提升。
Salesforce 使用 Claude Code Agents 将原本需要 231 天的代码迁移任务压缩至 13 天完成,同期 PR 数量上升但系统故障率反降 5%。这打破了'效率与质量不可兼得'的传统认知,核心在于将安全护栏和质量标准直接内嵌于 Agent 工作流中。作者强调,AI 真正的价值不在于加速现有流程,而在于重构工作方式、消除不必要的环节和交接。
Claude Code创始人Boris Cherny分享了AI编程工具如何重塑软件工程的核心洞察:工程师角色已从写代码转向编排AI工作流,Anthropic内部人均生产力提升200%,新工程师上手时间从数周缩短至两天。他预言通才工程师的黄金时代已到来,甚至对'品味'这一被认为是人类持久优势的东西提出了质疑。
Andrej Karpathy 在 Sequoia AI Ascent 2026 上提出「Agentic Engineering」概念,认为这是继 Vibe Coding 之后更具工程纪律的 AI 编程范式。他将 2025 年 12 月定义为 AI 编程能力的关键拐点,并以 Software 3.0(prompt 即编程)框架描述大模型作为解释器、上下文窗口作为核心杠杆的新开发方式。
Karpathy 在 Sequoia Ascent 2026 上提出 Software 3.0 框架:LLM 是解释器,上下文窗口就是程序本身,提示词/工具/记忆取代了传统代码。这不是现有开发流程的加速,而是一种范式跃迁——许多原本需要完整应用架构才能解决的问题,现在一个提示词即可完成。对 AI 创业者的核心追问是:哪些软件根本不应该继续以软件形态存在?
Karpathy 在 Sequoia Ascent 演讲中提出 Software 3.0 的概念框架,将 LLM 定义为继显式代码(1.0)和训练权重(2.0)之后的第三个可编程层,核心组成为提示词、智能体、工具、记忆与验证。他将 2025 年 12 月标记为 AI 智能体从演示走向实际生产的拐点。其核心判断是:下一代 AI 原生公司的竞争壁垒不在于 UI 封装,而在于谁拥有最强的验证闭环。
Andrej Karpathy 于2026年3月发布了一个约30行代码的AI自动化研究原型,让智能体自主编辑训练代码、运行实验并迭代优化,两天内完成700次实验,将GPT-2训练时间缩短11%。随后他加入Anthropic,将这一循环引入Claude的预训练流程,目标是用AI替代人工ML研究者加速训练优化的发现过程。
一个3人开发团队通过'氛围编程'架构(vibe coding)在生产环境中重建了两款产品,核心策略是:前端用AI生成,后端手写,通过开放API和MCP服务器连接两者。该团队从20人缩减至3人,同时保持甚至提升了交付速度。文章区分了哪些场景适合AI生成代码(展示层),哪些必须人工把控(系统记录层/安全逻辑)。
Karpathy在一场Agent开发者分享中指出,当前AI领域最大的错误是急于构建Agent而忽视底层大模型的夯实。他以2016年World of Bits项目失败为例,强调Demo容易但产品需要十年打磨,并认为真正站在Agent能力前沿的是独立开发者而非大厂,因为没有任何一家公司在Agent领域积累了五年以上。他还建议从神经科学中汲取灵感,把基础能力做扎实,Agent能力会自然涌现。
本文讲述了 Claude Code 的诞生历程:创始人 Boris Cherny 基于「模型能力远超现有产品」的判断,在 Anthropic 内部孵化了这款终端 AI 编程工具。产品初期几乎无人问津,直到 2025 年 5 月 Opus 4 发布后才迎来爆发式增长。核心洞察是:团队刻意为「下一代模型」而非当前模型构建产品,终端形态的轻量接口反而成为快速跟进模型迭代的战略优势。
Anthropic Claude Code 负责人 Boris Cherny 提出「AI 循环」概念:多个 AI Agent 相互协作、持续迭代优化代码,已使 Anthropic 工程师生产力提升近 70%。Claude Code 自身 90% 的代码由 Claude Code 编写,标志着 AI 自我改进能力进入实用阶段。工程师角色正在从写代码转向编排 AI Agent。
Anthropic Claude Code 创始人 Boris Cherny 表示,他每天管理数千甚至数万个 AI 代理,自己已八个月未手写一行代码。Claude Code 已实现自我编写与安全审查,并能自主浏览 GitHub 和 X 来决定下一步构建方向。他认为 AI 编程助手对软件创作的影响堪比古腾堡印刷机,将引发深远的社会变革。
Anthropic Claude Code负责人Boris Cherny分享了其运行多达15个并发AI会话的工作流,标志着AI辅助开发从人工提示交互进化到自主循环和大规模子智能体编排。Anthropic内部工程师生产力因此提升近70%,且Claude Code自身80-90%的代码由该方法生成。这一范式转变对AI工具投资和软件工程组织方式具有深远影响。