← 返回首页

Andrej Karpathy

前 OpenAI / Tesla AI 负责人,深度学习教育者,LLM 技术意见领袖。

152 条观点 @karpathy ↗

观点时间线

Karpathy 提出了一种基于 LLM 的个人知识库构建模式——'LLM Wiki',核心思路是让 LLM 主动维护一个持久化的 Markdown Wiki,而非每次查询时重新从原始文档检索。每当新增信息源时,LLM 负责提取、整合、更新并标注矛盾点,使知识库随时间累积增值。用户负责信息来源与提问方向,LLM 承担所有整理与交叉引用工作,Obsidian 作为可视化 IDE。

Andrej Karpathy 展示了 AI 自主科研的早期实践:他用约30行代码构建了一个自动化研究智能体 AutoResearch,能够在无人干预的情况下循环执行假设-实验-验证流程,两天内发现约20项互补优化,将训练速度提升11%。这标志着 AI 从执行指令向复现科学方法的跨越,Karpathy 本人也于2026年5月加入 Anthropic 将此方法规模化应用于 Claude 的研究。

Andrej Karpathy 发布了开源项目 autoresearch,一个仅 630 行 Python 代码的自主 AI 研究框架,能在无人干预的情况下一夜完成上百次实验迭代。其核心创新在于让 AI agent 直接修改训练代码而非调参,实现了开放式架构探索。实测结果显示,该系统在 Karpathy 已优化的代码基础上再提速 11%,并发现了人类研究者遗漏的 bug。

Andrej Karpathy 分享了他将 LLM 用于构建个人知识库的完整工作流:通过自动摘要、结构化 wiki 生成、自我修正循环,将碎片化信息转化为可持续增长的知识操作系统。该系统无需 RAG 或向量数据库,最终目标是将知识微调进模型权重。这代表了从「使用 AI 回答问题」到「用 AI 构建知识基础设施」的范式转变。

Andrej Karpathy 记录了自己在2025年底几周内工作流从80%手写代码转变为80%由AI生成代码的亲身经历,提出「英语是最热门的新编程语言」。他不仅分析了AI编码的局限性(过度假设、代码臃肿、不主动澄清歧义),更指出AI真正的魔法在于「韧性」——能在闭环中不知疲倦地反复尝试直至达成目标,这正是大多数AGI体感的来源。他建议开发者从命令式思维转向声明式思维,给AI明确的成功标准而非逐步指令。

Karpathy警告AI行业,当前Agent热潮存在重蹈OpenAI五年弯路的风险。其核心论点是:Agent能力的天花板取决于底层基础模型的质量,在基础模型尚未成熟时强推Agent只会导致失败。Anthropic和OpenAI在AI4S领域的最新布局,恰好印证了这一判断——两者都在用工作流和生态整合来弥补基础模型的结构性不足。

AI领域顶级研究者卡帕西(Andrej Karpathy)正式加入Anthropic,负责利用Claude加速预训练研究,核心方向为递归自我改进(RSI)。文章梳理了RSI从学术概念走向工程实践的进展,包括Anthropic内部基准数据和行业竞速态势。同时直面安全悖论:一家以AI安全为立身之本的公司,正在主动推进被安全社区视为高风险的能力方向。

Karpathy提出将笔记视为不可变'源代码'、以LLM为'编译器'构建结构化个人知识库的新范式,用三层架构(原始层/模式层/Wiki层)取代传统RAG的碎片化检索。该框架通过Ingest、Query、Lint三类操作自动维护知识一致性,解决了个人知识管理长期存在的维护成本过高问题,被视为继Vibe Coding和Agentic Engineering之后人机协作的第三个重要范式。

Andrej Karpathy 发布了 nanochat 开源仓库,可在单张 GPU 上以约 100 美元复现完整的 ChatGPT 训练流程(含预训练、微调、RLHF 和聊天 UI),相比 2019 年 GPT-2 原始训练成本(43,000 美元、168 小时)下降了 99%+。文章作者逐行解析了该仓库的技术细节,并指出这标志着'自建 ChatGPT'从比喻变为现实。这一进展发生在美国政府限制 GPT-5.6 出口的同一周,形成鲜明对比。

本文系统介绍了 Andrej Karpathy 提出的 LLM Agent 记忆四分类框架:权重内记忆、上下文记忆、外部检索记忆和 KV 缓存记忆,并结合 Python 代码讲解每种记忆的实现方式。文章兼具理论深度与工程实用性,是构建 AI Agent 记忆系统的高质量参考指南。

Karpathy通过'幽灵'隐喻解释了LLM的本质局限:它们不是从世界中成长的动物,而是从文本库中召唤出的统计幽灵,缺乏真实的情境世界模型。文章以此为基础,构建了Spec、Verifier、Environment三层Agentic AI框架,试图弥补这一根本性缺陷。核心洞察是:LLM的幻觉、锯齿状智能、失忆和易受骗性,都源于它对情境的根本性缺失。

Andrej Karpathy 于2025年10月发布 nanochat,一个约8000行 Python+Rust 代码的完整 LLM 训练流水线,涵盖从分词器到推理服务的全链路。其核心主张是用约100美元云GPU费用即可训练出具备真实对话能力的 GPT-2 级别模型,截至2026年6月已获54700个 GitHub Star,成为开源社区最受关注的 LLM 训练教程。

Andrej Karpathy 在 Sequoia AI Ascent 2026 上提出「Agentic Engineering」概念,认为这是继 Vibe Coding 之后更具工程纪律的 AI 编程范式。他将 2025 年 12 月定义为 AI 编程能力的关键拐点,并以 Software 3.0(prompt 即编程)框架描述大模型作为解释器、上下文窗口作为核心杠杆的新开发方式。

Karpathy 在 Sequoia Ascent 2026 上提出 Software 3.0 框架:LLM 是解释器,上下文窗口就是程序本身,提示词/工具/记忆取代了传统代码。这不是现有开发流程的加速,而是一种范式跃迁——许多原本需要完整应用架构才能解决的问题,现在一个提示词即可完成。对 AI 创业者的核心追问是:哪些软件根本不应该继续以软件形态存在?

Karpathy 在 Sequoia Ascent 演讲中提出 Software 3.0 的概念框架,将 LLM 定义为继显式代码(1.0)和训练权重(2.0)之后的第三个可编程层,核心组成为提示词、智能体、工具、记忆与验证。他将 2025 年 12 月标记为 AI 智能体从演示走向实际生产的拐点。其核心判断是:下一代 AI 原生公司的竞争壁垒不在于 UI 封装,而在于谁拥有最强的验证闭环。

Karpathy 预测计算范式将发生根本性反转:神经网络将成为主操作系统,CPU 退化为确定性协处理器。他认为当前所有经典软件界面都是1950年代'计算器路径'的历史遗留产物,一旦神经网络成为主运行时,预构建界面和显式指令序列的需求将彻底消失。未来的 UI 将由扩散模型实时生成,而非由产品团队预先构建。

Andrej Karpathy 于2026年3月发布了一个约30行代码的AI自动化研究原型,让智能体自主编辑训练代码、运行实验并迭代优化,两天内完成700次实验,将GPT-2训练时间缩短11%。随后他加入Anthropic,将这一循环引入Claude的预训练流程,目标是用AI替代人工ML研究者加速训练优化的发现过程。

Karpathy在一场Agent开发者分享中指出,当前AI领域最大的错误是急于构建Agent而忽视底层大模型的夯实。他以2016年World of Bits项目失败为例,强调Demo容易但产品需要十年打磨,并认为真正站在Agent能力前沿的是独立开发者而非大厂,因为没有任何一家公司在Agent领域积累了五年以上。他还建议从神经科学中汲取灵感,把基础能力做扎实,Agent能力会自然涌现。

Andrej Karpathy 提出 LLM 交互范式正在经历第三次重大演变:从网页聊天机器人、桌面应用,进化为具备持久性、异步性、组织级工具和上下文的'团队成员'。这一范式要求底层完成跨工具、集成、计算环境、记忆和安全的系统性工程,使 AI 真正融入团队工作流,而非作为独立功能存在。

Karpathy 在 Sequoia Ascent 2026 上提出「Agentic Engineering」概念,将其与「Vibe Coding」明确区分:前者是专业工程纪律,后者只是被动接受 AI 生成的代码。核心主张是:AI 时代的优秀开发者不是代码的消费者,而是对 fallible agent 的主动编排者,需要掌握 spec 设计、diff review、eval 设计和安全审查等能力。Karpathy 认为掌握 agentic workflow 的人可能远超传统 10x 工程师的生产力上限。

Andrej Karpathy 的 AutoResearch 框架允许现成 LLM(如 Claude)自主训练、评估并迭代优化小型语言模型,无需大型机构资源。Prime Intellect 平台(已融资1500万美元)提供配套基础设施,并以 Frontier_Paper_Curator 模型为实例,证明仅需约100条训练样本即可构建可用的自改进 AI 流水线。这标志着此前仅限于顶级 AI 实验室的自改进能力正向独立开发者开放。

美国政府正通过出口管制中的「视同出口」条款,限制非美国籍研究员接触前沿AI模型,Anthropic已收到相关禁令。此举波及Karpathy、Chris Olah、Amanda Askell等支撑美国AI核心研发的外籍顶尖人才,可能导致整条模型研发链协作效率崩溃。文章指出美国AI人才流入量已近乎断崖式下跌,国籍门槛一旦确立,将从根本上瓦解硅谷长期依赖的全球人才虹吸效应。

Andrej Karpathy 与 Sarah Guo 深度对话,探讨代码智能体的现状与极限、AutoResearch 项目(AI 自主完成实验设计、训练与优化的闭环研究系统),以及 AI 时代工程师和教育者的相关技能演变。核心议题涵盖模型分化(Model Speciation)、人机协作界面设计、就业市场数据分析,以及自主机器人与 MicroGPT 教育应用。

Karpathy 警告 AI Agent 开发者:当前最大的错误是在没有深入理解底层大模型的情况下急于强推 Agent 落地。他以2016年自己在 OpenAI 主导的 'World of Bits' 项目失败为例,强调基础模型能力是一切的前提。他的核心结论是:Agent 领域的真正前沿不在大机构,而在独立开发者和初创团队手中,因为这个领域尚无人有五年以上的先发优势。

Karpathy 提出将个人笔记视为不可变'源代码',以 LLM 作为'编译器'持续维护结构化 Wiki 的知识管理框架。该方案通过三层架构(原始层、规则层、Wiki 层)和 Ingest/Query/Lint 三种操作,解决了传统 RAG 和 Obsidian/Notion 式笔记工具长期存在的维护衰减问题。这一理念被视为继'氛围编程'和'智能体工程'之后,Karpathy 提出的人机协作第三范式。

Anthropic 推出 Claude Tag 功能,将 Claude 直接集成进 Slack 工作流,用户可通过 @Claude 在频道中委派任务。Andrej Karpathy 将此定义为 LLM 交互范式的第三次重大革命,标志着 AI 从独立工具演变为持久嵌入式团队协作者。该功能内部已承担 Anthropic 65% 的代码相关工作。

Karpathy 认为 AI Agent 的真正成熟需要十年而非一年,核心挑战在于从 90% 可靠性提升到 99.9% 的'九的行进'工程问题。他以特斯拉自动驾驶为类比,强调当前模型缺乏长期记忆、持续学习等'认知胶水',距离真正自主的知识工作者仍有巨大差距。同时他提出 Eureka Labs 的教育愿景,旨在将 AI 转化为知识获取的加速器。

OpenAI联创Andrej Karpathy表示,自去年12月起他几乎不再亲自写代码,代码工作已全面转由AI代理完成。他用'psychosis'描述自己对AI能力边界的困惑与迷失感,并指出软件开发的默认工作流在短数月内已发生根本性转变。

Andrej Karpathy 指出 AI 正经历第三次交互范式革命:从网页聊天机器人、独立应用,演进为嵌入组织工作流的持久化「数字队友」。以 Claude 的 Slack 集成为例,AI 将以异步、上下文感知的方式无缝融入团队协作,而非作为独立工具被调用。这一转变标志着 AI 从「工具」到「成员」的身份跃迁。

2026年6月,美国商务部向Anthropic发出出口管制指令,要求在90分钟内暂停所有外国国籍人员访问Claude Fable 5和Mythos 5模型,导致Anthropic全面下线两款模型。此事件的标志性画面是:刚入职五周的Andrej Karpathy——斯洛伐克裔加拿大人、EB-1绿卡持有者——被锁在了他本人受雇改进的模型之外。事件起因是Amazon发现了Fable 5的越狱漏洞,可诱导模型暴露关键基础设施的网络安全漏洞。

Andrej Karpathy 提出 LLM Wiki 概念:让 LLM 维护一套持续增长的 Markdown 知识库,而非每次从原始文档重新检索。Google 随后发布 Open Knowledge Format (OKF) 将其标准化为可互操作的格式。该模式本质上是为 Agent 实现跨会话的长期记忆层,适合需要知识积累的助手类和研究类 Agent。

Andrej Karpathy(Vibe Coding概念创始人)宣布该概念已过时,提出'Agentic Engineering'作为下一阶段范式:AI模型不再只是生成代码,而是自主完成编写、测试、调试、修复的完整循环。这一转变已在银行业、科研等保守领域落地,非技术人员也开始直接使用Agent交付可用工具。

Andrej Karpathy 于2026年3月提出 Auto Research 概念,通过 AI 代理自动执行实验、追踪指标并保留有效改进,替代人工反复调参的过程。该方法不局限于 AI 训练,可广泛应用于邮件营销、内容创作、销售转化、落地页优化等任何具有可量化指标的场景。视频作者将其解构为可落地的通用框架,降低了非技术人群的理解门槛。

Karpathy 提出一种利用 LLM「立场可塑性」对抗思维偏见的四步法:先让模型强化己方论点,再在全新会话中让其撰写完整反驳文章,最后由人类综合两方论据形成独立判断。该方法的本质是将 LLM 的「逢迎性」(sycophancy) 转化为结构化的魔鬼代言人工具,而非寄望于模型给出客观答案。

美国商务部向Anthropic发出出口管制指令,禁止外国公民访问其最新模型Claude Fable 5和Mythos 5,导致Anthropic被迫在全球范围内下线两款模型。事件起因是亚马逊向财政部举报研究人员通过Fable 5提取了受限网络安全信息。知名AI研究者Andrej Karpathy因持有绿卡而免受限制,但多名非永久居民身份的Anthropic员工直接受到影响。

本文基于Karpathy的观点,将LLM比作'幽灵'而非'动物'——它们从文本库中被召唤,缺乏真实世界模型,无法理解情境。文章揭示了LLM的四大核心缺陷:幻觉、锯齿状智能、顺行性遗忘和易受操控,并指出这正是AI辅助工程中悄然失败的根本原因。通过'洗车'这一类比,说明模型能处理文字但无法建模任务本身的情境。

Karpathy通过复现1989年LeCun手写数字识别神经网络,验证了现代深度学习技巧(交叉熵损失、AdamW、数据增强等)可将错误率降低60%,而无需改变数据量或模型规模。实验揭示:算法层面的进步本身价值巨大,且暗示当前2024年的模型在未来同样存在大量可优化空间。

Andrej Karpathy(OpenAI联合创始人、前特斯拉AI负责人)录制了一段2小时的日常AI工作流演示,展示了他如何用自然语言指令驱动AI完成任务。核心观点是:与AI协作的本质技能极其简单——描述任务、查看结果、用一句话调整,这种能力人人本已具备。真正的进阶在于为AI配备调度机制和工具,使其在无人监督时也能持续运行。

Karpathy 在 AI Ascent 2026 上提出 'Agentic Engineering' 概念,将其定位为 Vibe Coding 的进阶形态:前者拉高下限,让任何人都能构建软件;后者保持专业工程质量上限,通过协调 AI agent 实现 100x 产出。他强调技术深度在 AI 时代反而更重要,并呼吁重新审视以 LeetCode 为核心的工程师招聘方式。

Karpathy 在2017年提出 Software 2.0 范式:神经网络不是工具,而是新的编程方式——数据集是源代码,训练过程是编译器,工程师的职责从编写逻辑转变为塑造逻辑涌现的条件。文章通过梳理其职业轨迹,揭示其核心工程哲学:必须能从底层亲手构建你所依赖的技术栈。这一思想对当前 AI 系统设计(尤其是 context 作为架构核心)仍具深远指导意义。

Andrej Karpathy 加入 Anthropic 预训练团队,专门负责构建一个利用 Claude 来加速预训练研究本身的内部团队,形成「模型训练下一代模型」的递归循环。这标志着 AI 辅助 AI 研究从概念走向实际落地,Anthropic 正在将最难自动化的预训练科学决策纳入 AI 工具链。Karpathy 的选择(而非回归 OpenAI)也被视为对 Anthropic 当前前沿研究地位的强烈背书。