Andrej Karpathy
前 OpenAI / Tesla AI 负责人,深度学习教育者,LLM 技术意见领袖。
观点时间线
Karpathy 提出「循环工程」(Loop Engineering)概念,认为构建长时运行 Agent 的核心瓶颈不是模型智能,而是外部框架(Harness)的设计。他给出了包括角色分离、契约先行、状态持久化、自动重启等九条黄金法则,为多日运行的 AI Agent 开发提供了系统性方法论。
Andrej Karpathy 提出了一套完整的 AI 工程方法论,核心是将上下文窗口视为代码(Software 3.0),用工程化思维(规范设计、差异审查、评估循环)替代随意的 Prompt 尝试。他还推广了并行 Agent 管理模式和 CLAUDE.md 配置文件,构建出一套从世界观到具体工具的完整实践体系。
Karpathy 提出了一种基于 LLM 的个人知识库构建模式——'LLM Wiki',核心思路是让 LLM 主动维护一个持久化的 Markdown Wiki,而非每次查询时重新从原始文档检索。每当新增信息源时,LLM 负责提取、整合、更新并标注矛盾点,使知识库随时间累积增值。用户负责信息来源与提问方向,LLM 承担所有整理与交叉引用工作,Obsidian 作为可视化 IDE。
Andrej Karpathy 展示了 AI 自主科研的早期实践:他用约30行代码构建了一个自动化研究智能体 AutoResearch,能够在无人干预的情况下循环执行假设-实验-验证流程,两天内发现约20项互补优化,将训练速度提升11%。这标志着 AI 从执行指令向复现科学方法的跨越,Karpathy 本人也于2026年5月加入 Anthropic 将此方法规模化应用于 Claude 的研究。
Andrej Karpathy 发布了开源项目 autoresearch,一个仅 630 行 Python 代码的自主 AI 研究框架,能在无人干预的情况下一夜完成上百次实验迭代。其核心创新在于让 AI agent 直接修改训练代码而非调参,实现了开放式架构探索。实测结果显示,该系统在 Karpathy 已优化的代码基础上再提速 11%,并发现了人类研究者遗漏的 bug。
Andrej Karpathy 分享了他将 LLM 用于构建个人知识库的完整工作流:通过自动摘要、结构化 wiki 生成、自我修正循环,将碎片化信息转化为可持续增长的知识操作系统。该系统无需 RAG 或向量数据库,最终目标是将知识微调进模型权重。这代表了从「使用 AI 回答问题」到「用 AI 构建知识基础设施」的范式转变。
Andrej Karpathy 记录了自己在2025年底几周内工作流从80%手写代码转变为80%由AI生成代码的亲身经历,提出「英语是最热门的新编程语言」。他不仅分析了AI编码的局限性(过度假设、代码臃肿、不主动澄清歧义),更指出AI真正的魔法在于「韧性」——能在闭环中不知疲倦地反复尝试直至达成目标,这正是大多数AGI体感的来源。他建议开发者从命令式思维转向声明式思维,给AI明确的成功标准而非逐步指令。
Karpathy 提出的「循环工程」范式用持续自动化循环替代单次提示,核心是验证器+状态文件+停止条件三件套。其 AutoResearch 项目在2天内运行约700次实验,发现了人工遗漏的改进;Bilevel Autoresearch 在此基础上叠加元循环,同等基准上报告了5倍的收益。
Karpathy警告AI行业,当前Agent热潮存在重蹈OpenAI五年弯路的风险。其核心论点是:Agent能力的天花板取决于底层基础模型的质量,在基础模型尚未成熟时强推Agent只会导致失败。Anthropic和OpenAI在AI4S领域的最新布局,恰好印证了这一判断——两者都在用工作流和生态整合来弥补基础模型的结构性不足。
AI领域顶级研究者卡帕西(Andrej Karpathy)正式加入Anthropic,负责利用Claude加速预训练研究,核心方向为递归自我改进(RSI)。文章梳理了RSI从学术概念走向工程实践的进展,包括Anthropic内部基准数据和行业竞速态势。同时直面安全悖论:一家以AI安全为立身之本的公司,正在主动推进被安全社区视为高风险的能力方向。
Karpathy在YC AI创业学校演讲中提出「软件3.0」框架,将LLM类比为操作系统而非商品,强调提示词已成为新的编程语言。他指出AI自动化需满足感知、行动、监督三个前提,并警告从演示到成熟产品之间存在巨大鸿沟,认为这是「代理人的十年」而非一年。
Karpathy提出将笔记视为不可变'源代码'、以LLM为'编译器'构建结构化个人知识库的新范式,用三层架构(原始层/模式层/Wiki层)取代传统RAG的碎片化检索。该框架通过Ingest、Query、Lint三类操作自动维护知识一致性,解决了个人知识管理长期存在的维护成本过高问题,被视为继Vibe Coding和Agentic Engineering之后人机协作的第三个重要范式。
Andrej Karpathy 发布了 nanochat 开源仓库,可在单张 GPU 上以约 100 美元复现完整的 ChatGPT 训练流程(含预训练、微调、RLHF 和聊天 UI),相比 2019 年 GPT-2 原始训练成本(43,000 美元、168 小时)下降了 99%+。文章作者逐行解析了该仓库的技术细节,并指出这标志着'自建 ChatGPT'从比喻变为现实。这一进展发生在美国政府限制 GPT-5.6 出口的同一周,形成鲜明对比。
本文系统介绍了 Andrej Karpathy 提出的 LLM Agent 记忆四分类框架:权重内记忆、上下文记忆、外部检索记忆和 KV 缓存记忆,并结合 Python 代码讲解每种记忆的实现方式。文章兼具理论深度与工程实用性,是构建 AI Agent 记忆系统的高质量参考指南。
Andrej Karpathy 在 AI 创业学校的主题演讲中提出「Software 3.0」概念,认为自然语言正成为新的编程接口,LLM 是一种新型计算机。这一范式转变不仅改变了开发者的工具链,更重新定义了软件本身的构建方式。对开发者、用户和产品设计均有深远影响。
Karpathy通过'幽灵'隐喻解释了LLM的本质局限:它们不是从世界中成长的动物,而是从文本库中召唤出的统计幽灵,缺乏真实的情境世界模型。文章以此为基础,构建了Spec、Verifier、Environment三层Agentic AI框架,试图弥补这一根本性缺陷。核心洞察是:LLM的幻觉、锯齿状智能、失忆和易受骗性,都源于它对情境的根本性缺失。
nanochat 2026: Andrej Karpathy's Open-Source "ChatGPT for $100" — Full LLM Pipeline in 8,000 Lines
88Andrej Karpathy 于2025年10月发布 nanochat,一个约8000行 Python+Rust 代码的完整 LLM 训练流水线,涵盖从分词器到推理服务的全链路。其核心主张是用约100美元云GPU费用即可训练出具备真实对话能力的 GPT-2 级别模型,截至2026年6月已获54700个 GitHub Star,成为开源社区最受关注的 LLM 训练教程。
Andrej Karpathy 在 Sequoia AI Ascent 2026 上提出「Agentic Engineering」概念,认为这是继 Vibe Coding 之后更具工程纪律的 AI 编程范式。他将 2025 年 12 月定义为 AI 编程能力的关键拐点,并以 Software 3.0(prompt 即编程)框架描述大模型作为解释器、上下文窗口作为核心杠杆的新开发方式。
Karpathy 在 Sequoia Ascent 2026 上提出 Software 3.0 框架:LLM 是解释器,上下文窗口就是程序本身,提示词/工具/记忆取代了传统代码。这不是现有开发流程的加速,而是一种范式跃迁——许多原本需要完整应用架构才能解决的问题,现在一个提示词即可完成。对 AI 创业者的核心追问是:哪些软件根本不应该继续以软件形态存在?
Karpathy 在 Sequoia Ascent 演讲中提出 Software 3.0 的概念框架,将 LLM 定义为继显式代码(1.0)和训练权重(2.0)之后的第三个可编程层,核心组成为提示词、智能体、工具、记忆与验证。他将 2025 年 12 月标记为 AI 智能体从演示走向实际生产的拐点。其核心判断是:下一代 AI 原生公司的竞争壁垒不在于 UI 封装,而在于谁拥有最强的验证闭环。
Karpathy 预测计算范式将发生根本性反转:神经网络将成为主操作系统,CPU 退化为确定性协处理器。他认为当前所有经典软件界面都是1950年代'计算器路径'的历史遗留产物,一旦神经网络成为主运行时,预构建界面和显式指令序列的需求将彻底消失。未来的 UI 将由扩散模型实时生成,而非由产品团队预先构建。
Andrej Karpathy 于2026年3月发布了一个约30行代码的AI自动化研究原型,让智能体自主编辑训练代码、运行实验并迭代优化,两天内完成700次实验,将GPT-2训练时间缩短11%。随后他加入Anthropic,将这一循环引入Claude的预训练流程,目标是用AI替代人工ML研究者加速训练优化的发现过程。
Karpathy在一场Agent开发者分享中指出,当前AI领域最大的错误是急于构建Agent而忽视底层大模型的夯实。他以2016年World of Bits项目失败为例,强调Demo容易但产品需要十年打磨,并认为真正站在Agent能力前沿的是独立开发者而非大厂,因为没有任何一家公司在Agent领域积累了五年以上。他还建议从神经科学中汲取灵感,把基础能力做扎实,Agent能力会自然涌现。
Karpathy指出,AI Agent性能差距的根源在于'harness'(框架/脚手架)而非模型本身。同一模型在5个不同Agent框架下,基准分数从3.5%到80.1%相差76个百分点。他认为当前行业最大的误区是急于推出Agent产品,却未深入理解底层模型和系统机制。
Andrej Karpathy 提出 LLM 交互范式正在经历第三次重大演变:从网页聊天机器人、桌面应用,进化为具备持久性、异步性、组织级工具和上下文的'团队成员'。这一范式要求底层完成跨工具、集成、计算环境、记忆和安全的系统性工程,使 AI 真正融入团队工作流,而非作为独立功能存在。
Karpathy 在 Sequoia Ascent 2026 上提出「Agentic Engineering」概念,将其与「Vibe Coding」明确区分:前者是专业工程纪律,后者只是被动接受 AI 生成的代码。核心主张是:AI 时代的优秀开发者不是代码的消费者,而是对 fallible agent 的主动编排者,需要掌握 spec 设计、diff review、eval 设计和安全审查等能力。Karpathy 认为掌握 agentic workflow 的人可能远超传统 10x 工程师的生产力上限。
Andrej Karpathy 的 AutoResearch 框架允许现成 LLM(如 Claude)自主训练、评估并迭代优化小型语言模型,无需大型机构资源。Prime Intellect 平台(已融资1500万美元)提供配套基础设施,并以 Frontier_Paper_Curator 模型为实例,证明仅需约100条训练样本即可构建可用的自改进 AI 流水线。这标志着此前仅限于顶级 AI 实验室的自改进能力正向独立开发者开放。
美国政府正通过出口管制中的「视同出口」条款,限制非美国籍研究员接触前沿AI模型,Anthropic已收到相关禁令。此举波及Karpathy、Chris Olah、Amanda Askell等支撑美国AI核心研发的外籍顶尖人才,可能导致整条模型研发链协作效率崩溃。文章指出美国AI人才流入量已近乎断崖式下跌,国籍门槛一旦确立,将从根本上瓦解硅谷长期依赖的全球人才虹吸效应。
Andrej Karpathy 与 Sarah Guo 深度对话,探讨代码智能体的现状与极限、AutoResearch 项目(AI 自主完成实验设计、训练与优化的闭环研究系统),以及 AI 时代工程师和教育者的相关技能演变。核心议题涵盖模型分化(Model Speciation)、人机协作界面设计、就业市场数据分析,以及自主机器人与 MicroGPT 教育应用。
Karpathy 警告 AI Agent 开发者:当前最大的错误是在没有深入理解底层大模型的情况下急于强推 Agent 落地。他以2016年自己在 OpenAI 主导的 'World of Bits' 项目失败为例,强调基础模型能力是一切的前提。他的核心结论是:Agent 领域的真正前沿不在大机构,而在独立开发者和初创团队手中,因为这个领域尚无人有五年以上的先发优势。
Karpathy 提出将个人笔记视为不可变'源代码',以 LLM 作为'编译器'持续维护结构化 Wiki 的知识管理框架。该方案通过三层架构(原始层、规则层、Wiki 层)和 Ingest/Query/Lint 三种操作,解决了传统 RAG 和 Obsidian/Notion 式笔记工具长期存在的维护衰减问题。这一理念被视为继'氛围编程'和'智能体工程'之后,Karpathy 提出的人机协作第三范式。
1600 Lines of Code Build an Underwater Manhattan – Fable 5 Leaves AI Pioneer Andrej Karpathy Stunned
82AI模型Fable 5展示了惊人的3D世界生成能力,仅用1600行代码便能创建高度交互的沉浸式3D场景(如水下曼哈顿),一次性生成63个复杂世界,让AI领域先驱Karpathy直呼震撼。这标志着生成式AI在实时可玩3D内容创作上实现了质的飞跃。
Anthropic 推出 Claude Tag 功能,将 Claude 直接集成进 Slack 工作流,用户可通过 @Claude 在频道中委派任务。Andrej Karpathy 将此定义为 LLM 交互范式的第三次重大革命,标志着 AI 从独立工具演变为持久嵌入式团队协作者。该功能内部已承担 Anthropic 65% 的代码相关工作。
Andrej Karpathy 一份流传的十条规则 CLAUDE.md 文件(真实性未确认)在原有四条规则基础上新增六条,重点解决 AI 代码循环中验证、自检等后执行阶段的问题。开发者社区反响热烈,认为这些规则从根本上改变了对 agentic workflow 的思考方式,而不仅仅是提示词技巧。
Karpathy 认为 AI Agent 的真正成熟需要十年而非一年,核心挑战在于从 90% 可靠性提升到 99.9% 的'九的行进'工程问题。他以特斯拉自动驾驶为类比,强调当前模型缺乏长期记忆、持续学习等'认知胶水',距离真正自主的知识工作者仍有巨大差距。同时他提出 Eureka Labs 的教育愿景,旨在将 AI 转化为知识获取的加速器。
OpenAI联创Andrej Karpathy表示,自去年12月起他几乎不再亲自写代码,代码工作已全面转由AI代理完成。他用'psychosis'描述自己对AI能力边界的困惑与迷失感,并指出软件开发的默认工作流在短数月内已发生根本性转变。
Andrej Karpathy 指出 AI 正经历第三次交互范式革命:从网页聊天机器人、独立应用,演进为嵌入组织工作流的持久化「数字队友」。以 Claude 的 Slack 集成为例,AI 将以异步、上下文感知的方式无缝融入团队协作,而非作为独立工具被调用。这一转变标志着 AI 从「工具」到「成员」的身份跃迁。
2026年6月,美国商务部向Anthropic发出出口管制指令,要求在90分钟内暂停所有外国国籍人员访问Claude Fable 5和Mythos 5模型,导致Anthropic全面下线两款模型。此事件的标志性画面是:刚入职五周的Andrej Karpathy——斯洛伐克裔加拿大人、EB-1绿卡持有者——被锁在了他本人受雇改进的模型之外。事件起因是Amazon发现了Fable 5的越狱漏洞,可诱导模型暴露关键基础设施的网络安全漏洞。
Andrej Karpathy 提出 LLM Wiki 概念:让 LLM 维护一套持续增长的 Markdown 知识库,而非每次从原始文档重新检索。Google 随后发布 Open Knowledge Format (OKF) 将其标准化为可互操作的格式。该模式本质上是为 Agent 实现跨会话的长期记忆层,适合需要知识积累的助手类和研究类 Agent。
Andrej Karpathy(Vibe Coding概念创始人)宣布该概念已过时,提出'Agentic Engineering'作为下一阶段范式:AI模型不再只是生成代码,而是自主完成编写、测试、调试、修复的完整循环。这一转变已在银行业、科研等保守领域落地,非技术人员也开始直接使用Agent交付可用工具。
美国商务部突发出口管制令,禁止外国国籍人士访问Anthropic最新的Claude Fable 5和Mythos 5模型,导致两款模型全球下线。事件起因是亚马逊向财政部举报研究人员利用Fable 5提取受限网络安全信息。此次事件揭示了AI出口管制与全球化研发团队之间的深层矛盾。
Andrej Karpathy 于2026年3月提出 Auto Research 概念,通过 AI 代理自动执行实验、追踪指标并保留有效改进,替代人工反复调参的过程。该方法不局限于 AI 训练,可广泛应用于邮件营销、内容创作、销售转化、落地页优化等任何具有可量化指标的场景。视频作者将其解构为可落地的通用框架,降低了非技术人群的理解门槛。
Karpathy 提出一种利用 LLM「立场可塑性」对抗思维偏见的四步法:先让模型强化己方论点,再在全新会话中让其撰写完整反驳文章,最后由人类综合两方论据形成独立判断。该方法的本质是将 LLM 的「逢迎性」(sycophancy) 转化为结构化的魔鬼代言人工具,而非寄望于模型给出客观答案。
美国商务部向Anthropic发出出口管制指令,禁止外国公民访问其最新模型Claude Fable 5和Mythos 5,导致Anthropic被迫在全球范围内下线两款模型。事件起因是亚马逊向财政部举报研究人员通过Fable 5提取了受限网络安全信息。知名AI研究者Andrej Karpathy因持有绿卡而免受限制,但多名非永久居民身份的Anthropic员工直接受到影响。
本文基于Karpathy的观点,将LLM比作'幽灵'而非'动物'——它们从文本库中被召唤,缺乏真实世界模型,无法理解情境。文章揭示了LLM的四大核心缺陷:幻觉、锯齿状智能、顺行性遗忘和易受操控,并指出这正是AI辅助工程中悄然失败的根本原因。通过'洗车'这一类比,说明模型能处理文字但无法建模任务本身的情境。
Karpathy通过复现1989年LeCun手写数字识别神经网络,验证了现代深度学习技巧(交叉熵损失、AdamW、数据增强等)可将错误率降低60%,而无需改变数据量或模型规模。实验揭示:算法层面的进步本身价值巨大,且暗示当前2024年的模型在未来同样存在大量可优化空间。
Andrej Karpathy(OpenAI联合创始人、前特斯拉AI负责人)录制了一段2小时的日常AI工作流演示,展示了他如何用自然语言指令驱动AI完成任务。核心观点是:与AI协作的本质技能极其简单——描述任务、查看结果、用一句话调整,这种能力人人本已具备。真正的进阶在于为AI配备调度机制和工具,使其在无人监督时也能持续运行。
Karpathy 在 AI Ascent 2026 上提出 'Agentic Engineering' 概念,将其定位为 Vibe Coding 的进阶形态:前者拉高下限,让任何人都能构建软件;后者保持专业工程质量上限,通过协调 AI agent 实现 100x 产出。他强调技术深度在 AI 时代反而更重要,并呼吁重新审视以 LeetCode 为核心的工程师招聘方式。
Karpathy 在2017年提出 Software 2.0 范式:神经网络不是工具,而是新的编程方式——数据集是源代码,训练过程是编译器,工程师的职责从编写逻辑转变为塑造逻辑涌现的条件。文章通过梳理其职业轨迹,揭示其核心工程哲学:必须能从底层亲手构建你所依赖的技术栈。这一思想对当前 AI 系统设计(尤其是 context 作为架构核心)仍具深远指导意义。
Andrej Karpathy 加入 Anthropic 预训练团队,专门负责构建一个利用 Claude 来加速预训练研究本身的内部团队,形成「模型训练下一代模型」的递归循环。这标志着 AI 辅助 AI 研究从概念走向实际落地,Anthropic 正在将最难自动化的预训练科学决策纳入 AI 工具链。Karpathy 的选择(而非回归 OpenAI)也被视为对 Anthropic 当前前沿研究地位的强烈背书。