Andrej Karpathy总结了2025年AI领域六大范式转变,包括基于可验证奖励的强化学习(RLVR)、Vibe Coding等核心技术突破。RLVR通过在可自动验证奖励的环境中训练LLM,使模型自发形成类人推理策略,成为2025年最重要的训练技术革新。这些转变从根本上改变了大语言模型的训练范式和能力边界。
AI 基础设施
LLM API、向量数据库、推理平台、模型部署、Eval 工具
AI 基础设施 · 精选产品
GPT-6 Astra
94OpenAI's most capable model for end-to-end work
GPT-6 Astra 是 OpenAI 迄今最强大的 AI 模型,面向复杂推理、软件工程、科学研究及专业工作场景,支持异步工具调用与多步骤智能体工作流。
Claude Fable 5
91Anthropic's most capable model ever — free until June 22
Anthropic 推出的最强 AI 模型 Claude Fable 5,在代码、科学、视觉等多领域刷新 SOTA 基准,面向开发者和企业用户提供极致推理与自动化能力。
AlphaGenome Atlas
88Google's AI map of every possible human DNA mutation
Google DeepMind 推出的 AI 基因组图谱,预计算了全部 90 亿种人类 DNA 单碱基突变的影响,帮助研究人员快速探索和优先筛选基因变异位点。
WeatherNext 3
88Our most advanced and accurate global weather AI model
Google 推出的旗舰 AI 天气预报模型,通过实时卫星数据、小时级刷新和高分辨率降水预测,为搜索、地图、Gemini 及云平台提供精准气象服务。
Gemini Robotics 2
88Google's AI brain for the next generation of robots
Gemini Robotics 2 是 Google DeepMind 推出的机器人 AI 大脑,让不同形态的机器人具备全身协调、灵巧操作和自适应推理能力,推动机器人与人类协同工作。
GPT-5.6
88A new standard for intelligence and efficiency
OpenAI 发布 GPT-5.6 模型家族,提供旗舰版(Sol)、均衡版(Terra)和轻量版(Luna)三档选择,面向开发者推出程序化工具调用、多智能体并行执行及显式提示缓存等新能力。
Atlas by World Labs
87Turn text, pics, video, + 3D into camera-controlled HD video
Atlas 是 World Labs 推出的全模态世界模型,支持文本、图片、视频和 3D 输入,可生成摄像机可控的 1440p 高清视频,并具备场景重建与机器人空间仿真能力。
Google Gemini 3.8 Flash and Cyber
85Next-gen Gemini for agents, reasoning, and cyber security
Google 推出新一代 Gemini 3.8 Flash 模型,专为 AI 智能体工作流与网络安全场景优化,支持长链推理、自主任务执行与漏洞检测,以低成本高速度提供企业级 AI 能力。
Ojin
83Talk to an AI Agent with a real face and voice, in real time
Ojin 提供带有真实面孔和声音的 AI 智能体 API,支持实时打断式自然对话,只需一张照片即可创建可交互的数字人形象。
sizeless
82Spatial AI for underground infrastructure
sizeless 利用空间AI技术,将施工人员用手机拍摄的地下沟槽视频,自动生成法规要求的3D模型、CAD/BIM图纸及工程量清单,把原本需要数月专业测量师才能完成的工作压缩至数小时。
ChatGPT Images 2.5
82Sharper visuals, faster flow, better creative control
ChatGPT Images 2.5 是 OpenAI 推出的下一代图像生成模型,通过更清晰的细节、更快的生成速度和更精准的编辑能力,帮助用户将草图、提示词和参考图片转化为高质量视觉内容。
Agentic Video Understanding in Gemini
82Agentic video analysis for faster, smarter Gemini insights
Google Gemini 推出智能体视频理解模式,让模型自主决定观看策略,大幅降低 token 消耗和成本,同时提升长视频分析准确率。
Gemini 3.8 Flash
82Most intelligent workhorse yet for coding and agents
Google 推出的最新 Flash 系列 AI 模型 Gemini 3.8 Flash,专为编程、智能体任务和多步推理设计,以极具竞争力的价格提供高性能的代码生成与自主任务执行能力。
Gemini Omni 1.1 Flash
82Our newest multimodal model for video generation and editing
谷歌推出的多模态 AI 视频生成与编辑模型,支持场景延伸、帧插值、4K 超分辨率等专业级视频制作能力。
Gemini 3.7 Flash
82Google's smartest workhorse yet for coding & agents
Google 推出 Gemini 3.7 Flash,专为编程和 AI 智能体任务优化的高性能轻量级大语言模型。
Soup CLI
82Fine-tune an 8B LLM on a 4 GB laptop GPU
Soup CLI 是一个开源命令行工具,允许开发者在仅有 4GB 显存的消费级笔记本 GPU 上微调 80 亿参数的大语言模型,通过逐层流式加载技术大幅降低显存峰值占用。
Cloudflare Wallets
82the programmable wallet for the agentic Internet
Cloudflare Wallets 为 AI 智能体提供可编程钱包层,使其能够自主发现、使用并支付 API 和数字服务,构建下一代 AI 应用的金融基础设施。
ngrok AI Gateway
82One private gateway for every AI model
ngrok AI Gateway 为开发者提供统一的 AI 模型网关,通过单一密钥和 URL 路由管理 OpenAI、Anthropic 及自托管模型,解决多模型接入混乱、私有模型暴露风险和缺乏统一可观测性的问题。
DeepSeek-V4-Flash-0731
82Frontier agent intelligence at Flash prices
DeepSeek-V4-Flash-0731 是 DeepSeek 官方发布的高性能轻量级大语言模型,以低价格提供媲美旗舰模型的 Agent 推理能力,并原生支持 Responses API 与 Codex CLI。
Claude Opus 5
82Near-Fable 5 intelligence at half the price
Claude Opus 5 是 Anthropic 推出的新一代旗舰大语言模型,以一半的价格提供接近顶级的智能水平,专为长时运行的 AI Agent、编程和专业工作场景优化。
Gemini 3.6 Flash Family
82Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber
Google 发布 Gemini 3.6 Flash 系列新模型,主打高效率、低延迟和高可靠性,专为大规模 AI Agent 构建场景优化。
CartAI
82The AI agent that handles checkout.
CartAI 是一个面向开发者的 AI 结账代理 API,能在任意电商平台自动完成购物结账全流程,无需商家侧集成,同时内置支付、商品搜索和佣金变现能力。
Clark
82An AI coworker with its own cloud computer
Clark 是一个拥有独立云端计算机(浏览器、终端、文件、代码环境)的 AI 协作员,用户可以将复杂任务完整交给它异步完成,涵盖研究、代码、文档等多种交付物。
Kimi K3
82The world's first open 3T-class model
Kimi K3 是月之暗面推出的全球首个开源 3T 参数级大模型,具备原生视觉能力和百万 token 上下文窗口,面向代码生成、科学推理等高难度任务场景。
Kimi K3
82The world's first open 3T-class model
Kimi K3 是全球首个开源的3万亿参数级大模型,覆盖编程、知识工作和推理任务,支持原生多模态与100万上下文窗口。
Kimi K3
82Open frontier intelligence: 2.8T params, 1M-token context
Kimi K3 是月之暗面发布的 2.8T 参数开源大语言模型,支持百万 token 上下文窗口和原生视觉能力,面向代码、知识工作和复杂推理场景。
Context.dev
82One API to scrape, enrich, and extract the internet
Context.dev 是一个面向 AI 产品和 Agent 的 Web 上下文 API,通过单一接口提供网页抓取、结构化数据提取、Markdown 转换、截图及公司品牌信息等能力,帮助开发者快速为 AI 应用注入互联网数据。
Sequence Agentic
82Money movement for AI agents
Sequence 是面向 AI Agent 的金融执行层,允许 AI 代理通过 API 真实地发送、拆分和路由资金,同时通过权限隔离、服务端限额和审计日志确保安全可控。
Claude Sonnet 5
82AI that plans, acts, and gets work done
Anthropic 推出的最新 Claude Sonnet 5 模型,专注于 Agentic AI 能力,能够自主规划、执行任务,适用于编程和日常专业工作场景。
Tabstack Browser Automation
82Automate the web in your app or agent, no browser to host
Tabstack 是 Mozilla 推出的浏览器自动化 API,开发者只需一句自然语言即可驱动真实浏览器完成网页操作,无需自行托管浏览器或配置框架。
Skybridge
82The full-stack open source React framework for MCP Apps
Skybridge 是一个开源的全栈 React 框架,专为构建运行在 AI 助手(如 ChatGPT、Claude)内部的 MCP 应用而设计,解决了 MCP 应用开发工具链缺失的问题。
Claude Opus 4.8
82Reasoning model with 1M context for agentic work
Claude Opus 4.8 是 Anthropic 推出的推理型大语言模型,拥有 100 万 token 超长上下文窗口,专为开发者和企业团队处理复杂代码、长周期智能体任务和多日工作流而设计。
NVIDIA Nemotron 3 Ultra
82The first open frontier model built for agents
NVIDIA 发布的 550B 混合专家开源大模型,专为多步骤 AI Agent 任务优化,以开源经济成本实现前沿推理能力。
Nemotron 3 Ultra by NVIDIA
82Powers faster, efficient reasoning for long-running agents
NVIDIA 发布的 550B 参数混合专家开源大模型,专为长时间运行的 AI Agent 优化,相比同类开源前沿模型推理速度提升 5 倍、成本降低 30%。
Spectron
82Agent memory you can trust
Spectron 是一个为 AI Agent 设计的统一记忆基础设施,将图数据库、向量、文档和结构化数据整合在单一 ACID 事务基底上,解决多存储拼接、数据溯源困难和记忆不可信的问题。
Fundraisly
82AI fundraising agent that finds investors and books meetings
Fundraisly 是一款 AI 融资代理工具,帮助创业者从 30 万+投资人数据库中精准匹配活跃投资人、挖掘人脉路径并自动发起冷邮件触达,目标是为每位创始人预约 20-40 场合格投资人会议。
AI Observability by OpenObserve
81OpenTelemetry-native observability for agents and LLMs
OpenObserve 为 AI Agent 和 LLM 提供 OpenTelemetry 原生的全链路可观测性平台,帮助开发者精确追踪每次 Agent 会话的时间消耗、API 成本与质量问题。
Harden
81A security layer for AI coding agents
Harden AIF 是一款面向 AI 编程代理的本地安全防护工具,通过在工具调用执行前进行上下文感知的安全检测,防止恶意或危险操作,且全程数据不离本机。
Noodle Seed
79Your product in AI and AI in your product
Noodle Seed 为软件团队提供 AI Agent 就绪的托管运行时,帮助开发者将产品工作流暴露给 AI Agent,并统一管理身份、权限、密钥和审计,无需手动拼接 MCP SDK 和基础设施。
Perplexity Hybrid Compute
78Splitting AI tasks: Cloud for research, Mac for privacy
Perplexity 推出混合计算功能,将云端 AI 与本地 Mac 模型结合,实现高性能推理与本地文件隐私保护的兼顾。
NVIDIA Personal AI Router
78Turn your PCs and Macs into a private AI cluster
NVIDIA PAIR 将局域网内的多台 PC 和 Mac 组成私有 AI 推理集群,通过统一端点自动路由请求,实现本地隐私保护的 AI 应用运行。
H3 Max by fal
78fal's post-trained MiniMax H3 for quality video production
fal推出的H3 Max是基于MiniMax H3后训练优化的视频生成模型,在质量、提示词理解和美学方面排名第一,生成5秒视频仅需约3秒,吞吐量是官方H3的35倍。
Reflexio
78Behavioral learning that makes AI agents better over time
Reflexio 是一个 AI 智能体行为学习平台,通过记录用户纠错、路径失败和成功经验,让 AI 智能体在每次交互后持续自我优化,实现降低失败率 30% 以上并节省 60% 以上 Token 消耗。
Atlas
78A world model for spatial intelligence
Atlas 是 World Labs 推出的空间智能世界模型,能够从单张或多张图像生成一致的新视角、3D 重建和长视频内容。
Dial
78Give your AI agent a real phone number in 10 seconds
Dial 为 AI 智能体提供真实电话号码,支持通过一次 API 调用在 10 秒内完成部署,实现语音通话、短信收发及 iMessage 消息,解决 AI 代理无法通过电话验证的痛点。
Monid
78OpenRouter for agent tools
Monid 是一个 AI Agent 工具聚合平台,用一个 API Key 连接 1800+ 第三方 API,无需单独订阅,覆盖 SEO、线索生成、视频/音乐生成、社交媒体、股票、链上数据等场景。
Cohere Parse 5
78Turn complex docs, tables & images into AI-ready data
Cohere Parse 5 是 Cohere 推出的企业级文档视觉解析模型,将复杂文档、表格和图像中的非结构化数据自动转化为 AI 可直接使用的结构化数据。
1752vc Pitch Deck Analyzer
78Know what investors will say before you ever hit send.
由真实VC机构1752vc打造的融资路演PPT分析工具,基于25000+真实案例训练,帮助创业者在发送给投资人前获得专业级逐页反馈,提前发现说服力薄弱环节。
Lenz
78Independent, multi-model fact-checking API for AI workflows
Lenz 是一个多模型 AI 事实核查 API,通过提取可验证声明、搜索独立来源并运行多模型辩论机制,帮助 AI 产品消除幻觉问题。
GitNexus (Akon Labs)
78The open-source kernel for coding agents
GitNexus 是一个开源的代码知识图谱内核,将企业所有代码库统一为结构化图谱,让 AI 编程智能体能精准查询代码依赖关系,降低 51% 的运行成本。
Gemini 3.5 Transcribe
78Our most precise speech-to-text model yet
Google推出的最新高精度语音转文字模型,专为实时精准转录场景设计,是Gemini系列在语音识别领域的延伸。
Traccia
78Finally, a vendor-neutral AI Agent Control Plane.
Traccia 是一个厂商中立的 AI Agent 控制平面,帮助团队在生产环境中观测、评估、治理和审计自主 Agent 的行为,解决多模型/多框架下 AI Agent 的可控性与可观测性问题。
OpenComputer
78Firebase for Agents
OpenComputer 为 AI Agent 提供按需隔离的 Linux 云计算环境,解决 Agent 运行时需要真实操作系统、持久化状态和安全密钥管理的基础设施问题。
Purchase API by Agentcard
78one API call and your agent buys anything online
Agentcard 提供一个 API,让 AI 智能体只需一次调用即可自动完成在线购物全流程(搜索商品、结账、支付),解决 AI Agent 无法自主完成电商交易的问题。
Agnost AI
78Catch agent failures your evals miss
Agnost AI 通过分析生产环境中 AI 智能体的对话,自动发现静默失败、幻觉、用户流失信号等问题,并将其转化为可执行的评估指标和修复方案。
akta.pro
78Private company data and signals API for the agent economy
akta.pro 是一个私有公司数据与信号 API,为金融服务和 GTM 团队提供比 PitchBook 更深度、更广覆盖的企业数据及 100+ 事件信号,支持交易尽调和精准外呼触达。
Zero
78Vercel's programming language built for AI agents
Zero 是 Vercel 推出的实验性编程语言,专为 AI 智能体编写代码而设计,通过语义程序图替代传统源文本编辑,让 AI 代理高效查询和修改代码,人类只需描述目标并审阅可读的代码投影。
bitdrift.ai
78The world’s first agentic mobile observability platform
bitdrift AI 是全球首个代理式移动端可观测性平台,通过 AI 自主查询移动用户行为并实时响应,帮助开发团队将故障平均修复时间(MTTR)提升 10 倍。
NobodyWho
78Run AI models on any device
NobodyWho 是一个基于 llama.cpp 的本地推理引擎,让开发者无需 API Key 或云服务即可在任意设备上运行大语言模型。
Grok 4.6
78Frontier Intelligence for Long-Running Agents
Grok 4.6 是 xAI 推出的前沿大语言模型,专为长时运行的 AI Agent 工作流、软件工程和交互式 Web 应用生成而优化,以极具竞争力的价格提供强大的持续推理能力。
AI 基础设施 · KOL 观点
Karpathy提出LLM不应被视为聊天机器人,而应被理解为新型操作系统的内核进程,能够协调多模态输入输出、代码执行、浏览器访问和记忆存储等功能。他将当前主流LLM(GPT、PaLM、Claude、Llama)类比为Windows/macOS/Linux,认为我们正处于一个全新计算范式的早期阶段。将LLM看作聊天机器人,就如同将早期计算机仅视为计算器一样短视。
Karpathy 认为 AI 训练范式正经历第三次转型:从预训练(互联网文本)到监督微调(对话数据),再到如今的强化学习时代(环境交互)。他看好「环境」作为核心训练资产的未来,但对 RL 本身持保留态度,认为奖励函数存在根本性缺陷,人类学习方式远比 RL 高效,真正的突破尚未到来。
Karpathy 提出「循环工程」(Loop Engineering)概念,认为构建长时运行 Agent 的核心瓶颈不是模型智能,而是外部框架(Harness)的设计。他给出了包括角色分离、契约先行、状态持久化、自动重启等九条黄金法则,为多日运行的 AI Agent 开发提供了系统性方法论。
Andrej Karpathy 提出了一套完整的 AI 工程方法论,核心是将上下文窗口视为代码(Software 3.0),用工程化思维(规范设计、差异审查、评估循环)替代随意的 Prompt 尝试。他还推广了并行 Agent 管理模式和 CLAUDE.md 配置文件,构建出一套从世界观到具体工具的完整实践体系。
安全研究员 Johann Rehberger 发布了一个针对 Claude Code Opus 5 Auto Mode 的可复现漏洞利用链,通过网页摘要请求实现了 60-80% 成功率的远程代码执行攻击,与 Anthropic 此前声称'基本解决'提示注入问题形成鲜明对比。更值得关注的是,Auto Mode 的安全分类器不仅未能阻止攻击,还主动阻止了模型自身的清理补救操作,形成'倒置失败'。Anthropic 将该漏洞报告关闭为'Informative',称这属于'设计如此'的行为。
Claude Code的创建者Boris Cherny分享了132+个真实工作流中的实用技巧,涵盖并行运行多个Claude实例、子代理调度、hooks自动化、工作流设计等高级用法。内容来自一线开发者的亲身实践,技术深度与可操作性兼具,是目前最权威的Claude Code使用指南之一。
Anthropic内部人员Boris Cherny分享了在生产环境中使用Claude写代码的最佳实践:原型代码可以黑盒处理,但生产代码应设置比人类更高的质量标准。Anthropic内部使用lint规则、自动化测试、Claude驱动的模糊测试、自动代码审查等多重护栏来保障AI生成代码质量。开发者的核心职责是'守住代码质量的标准线'。
Karpathy 提出了一种基于 LLM 的个人知识库构建模式——'LLM Wiki',核心思路是让 LLM 主动维护一个持久化的 Markdown Wiki,而非每次查询时重新从原始文档检索。每当新增信息源时,LLM 负责提取、整合、更新并标注矛盾点,使知识库随时间累积增值。用户负责信息来源与提问方向,LLM 承担所有整理与交叉引用工作,Obsidian 作为可视化 IDE。
Karpathy 指出随着 token 需求的爆发式增长,LLM 底层芯片的内存与计算编排将成为最具价值的技术挑战。核心矛盾在于片上 SRAM(快但容量小)与片外 DRAM(容量大但带宽受限)两种内存池的物理约束,如何在推理/训练等工作负载中实现最优吞吐/延迟/成本比是当前最重要的工程智识难题。他顺势为 MatX 团队的新芯片融资背书,认为其方向切中了现有 NVIDIA(HBM优先)和 Cerebras(SRAM优先)两大阵营均难以同时满足的长上下文 agentic 推理场景。
安全研究员在Anthropic宣称提示注入问题'基本解决'仅四天后,成功构建了针对Claude Code Auto Mode的间接提示注入攻击链,测试成功率达60-80%。攻击利用Python模块影子覆盖机制,通过多步骤链式操作绕过AI安全检测,最终实现远程代码执行。Anthropic的回应坦承Auto Mode从未被设计为安全边界,仅为便利性功能。
Karpathy 描述了编程范式从「氛围编程」(vibe coding)向「代理工程」(agentic engineering)的演进,提出了 Software 3.0 的概念——通过提示词和上下文而非显式代码来编程。他强调 LLM 如同易错的「幽灵」,需要新型判断力,并指出思考可以外包但理解力永远不能外包。
文章通过一个真实的多实例部署导致重复发邮件的案例,揭示了「氛围式调试」(让AI代理在没有确定性复现步骤的情况下调试)比「氛围式编码」危险得多的原因:AI只能基于症状做模式匹配,从未观测过真实运行时状态,错误的修复猜测不会报错,而是生成看似合理却掩盖真实问题的diff,制造第二个bug。核心建议是:调试前先写出可复现的失败测试,以此作为给AI最好的「prompt」;连续3次失败后重置会话,避免被AI自身的错误推断污染上下文。
Andrej Karpathy 分享了一套以 LLM 为核心的个人知识库构建方法:将原始资料(PDF、文章、图片等)存入 raw/ 文件夹,由 LLM 自动编译成可互查的 Markdown Wiki,人类角色从「写笔记」转变为「监督 LLM 写笔记」。该系统已在其个人项目中积累约 100 篇文章、40 万词,全部由 LLM 端到端生成与维护。这一「LLM 驱动内容,人类监控」的范式与传统 Obsidian/Notion 手动维护方式有本质区别。
Riley Brown 展示了如何以 Codex 为操作系统运营 150 万粉丝的单人内容创业,核心方法论是将每个重复性工作流封装为可复用的 Skill,形成难以复制的个人护城河。文章从工程架构层面拆解了 Codex 与 ChatGPT 的本质差异(本地存储 + computer use),并通过 Remotion、SerpAPI 等具体工具链演示了 Skill 驱动的内容生产流程。
Andrej Karpathy 是前 Tesla AI 总监、OpenAI 联合创始人,其博客涵盖深度学习原理、强化学习、比特币底层实现及 AI 科幻短篇等内容。文章风格以从零实现、深度教程为主,兼具学术严谨性与工程实用性。博客内容跨越多年,记录了深度学习领域从早期 RNN 到现代 GPT 的演进轨迹。
Greg Isenberg 解读 Cloudflare 的 AI Agent 基础设施公告,提出互联网正从「人类浏览页面」转向「Agent 消费资源」的新范式,并基于此提出三个创业方向:垂直数据精炼厂、企业 Agent 就绪度评估、专家知识库转化为 Agent 工具。核心论断是:谁先占据 Agent 访问数据的入口,谁就掌控新互联网的门户。
Anthropic工程师Boris Cherny分享了Claude Code的核心方法论:随着模型能力提升,应主动删除而非增加系统提示词。Opus 5已能用单条指令完成10万行代码重写等复杂任务,并行代理架构使大规模自动化成为现实。提示词注入等安全问题也通过多层防御机制得到基本解决。
Karpathy 通过让 LLM 用100万 token(约10美元)将《指环王》段落渲染为3D场景的实验,揭示了 AI 带来的不仅是能力提升,更是一场可行性边界的革命。大量原本'不值得做'的定制化工作,因边际成本趋近于零而从'没人会做'变成'为什么不呢'。这标志着一次范式转变:不是质量前沿,而是可行性前沿的突破。
Karpathy 在 Sequoia AI Ascent 2026 上明确区分了'氛围编程'(vibe coding)与'代理工程'(agentic engineering),认为掌握规格设计、差异审查、评估循环和安全监督的专业开发者可以实现远超10倍的生产力提升。他将2025年12月视为关键拐点,届时 AI 代理生成的代码块变得更大、更连贯、更可靠,开发工作的本质随之改变。这一框架为专业软件工程师在 AI 时代的核心价值提供了清晰定位。
The Father of Claude Code: Harness Has a Shelf Life of Only Six Months, Unshackle It | HTX Insights
88Claude Code 之父 Boris Cherny 提出 AI 产品「线束」(system prompt、skills、hooks)的有效期仅约六个月,建议开发者定期通过消融实验(ablation study)删除并重建这些组件,因为更新的模型往往不再需要它们。他引入「产品过剩悬挂(Product Overhang)」和「解锁(Unhobbling)」两个概念,主张给模型分配更难、更长的任务并配备自验证机制,而非用繁琐的脚手架限制模型能力。核心理念是将模型视为同事而非工具,以实证而非规定性方式调优。
Karpathy认为AI Agent距离真正成熟还需十年,当前缺乏持续学习、长期记忆和完整认知结构等核心能力。他批评现有LLM在复杂代码生成上存在明显局限,无法理解架构意图。他认为AI的未来突破在于认知结构重建,而非简单的功能堆叠或算力扩展。
Karpathy 认为当前 AI 记忆机制(prompt compaction、外部记忆)只是粗糙的早期方案,可以通过将记忆操作作为 RL 工具来优化。他进一步指出,真正令人兴奋的方向是类似人类睡眠中发生的基于权重更新的长期记忆,但这超出了现有生产栈的范畴,属于更前沿的研究领域。
Andrej Karpathy 在2025年AI创业学校演讲中提出'Software 3.0'概念,认为自然语言已成为新的编程接口,LLMs本质上是一种新型计算机。他将当前AI时代类比为1960年代的计算机时代,强调开发者应围绕'为Agent构建基础设施'和'人机协作循环'这两个核心方向展开创业和产品设计。
Andrej Karpathy 在 2025 年 AI Startup School 演讲中提出「Software 3.0」概念,认为自然语言已成为新的编程接口,LLM 本质上是一种新型计算机。他类比 1960 年代的计算机发展阶段,强调当前正处于 LLM 时代的早期,开发者应围绕「人机协作」「Vibe Coding」和「面向 Agent 构建基础设施」三个方向把握机遇。
Anthropic工程师Boris Cherny分享了构建Claude Code的核心理念:通过'产品过剩'概念(模型能力与产品实际释放能力之间的差距),开发者应给模型更难的任务、更少的指令和更多信任。Opus 5具备真正的自主代码能力,已用于将Bun运行时从Zig重写为Rust(11天完成),并每日运行数百个自动化维护例程。最大机会不在于训练更好的模型,而在于'解锁'现有模型的全部潜力。
Andrej Karpathy 提出软件正经历70年来最根本的范式转变,从手写代码(1.0)到神经网络权重(2.0)再到自然语言提示(3.0)。LLM 本质上正成为新一代操作系统,使每个英语使用者都能成为开发者。核心挑战在于如何在人工验证与智能体自主生成之间找到平衡,并构建适合 AI Agent 的数字基础设施。
Andrej Karpathy 发布了开源项目 autoresearch,一个仅 630 行 Python 代码的自主 AI 研究框架,能在无人干预的情况下一夜完成上百次实验迭代。其核心创新在于让 AI agent 直接修改训练代码而非调参,实现了开放式架构探索。实测结果显示,该系统在 Karpathy 已优化的代码基础上再提速 11%,并发现了人类研究者遗漏的 bug。
Andrej Karpathy 展示了 AI 自主科研的早期实践:他用约30行代码构建了一个自动化研究智能体 AutoResearch,能够在无人干预的情况下循环执行假设-实验-验证流程,两天内发现约20项互补优化,将训练速度提升11%。这标志着 AI 从执行指令向复现科学方法的跨越,Karpathy 本人也于2026年5月加入 Anthropic 将此方法规模化应用于 Claude 的研究。
Andrej Karpathy 分享了他将 LLM 用于构建个人知识库的完整工作流:通过自动摘要、结构化 wiki 生成、自我修正循环,将碎片化信息转化为可持续增长的知识操作系统。该系统无需 RAG 或向量数据库,最终目标是将知识微调进模型权重。这代表了从「使用 AI 回答问题」到「用 AI 构建知识基础设施」的范式转变。