Karpathy 提出「循环工程」(Loop Engineering)概念,认为构建长时运行 Agent 的核心瓶颈不是模型智能,而是外部框架(Harness)的设计。他给出了包括角色分离、契约先行、状态持久化、自动重启等九条黄金法则,为多日运行的 AI Agent 开发提供了系统性方法论。
AI 基础设施
LLM API、向量数据库、推理平台、模型部署、Eval 工具
AI 基础设施 · 精选产品
Claude Fable 5
91Anthropic's most capable model ever — free until June 22
Anthropic 推出的最强 AI 模型 Claude Fable 5,在代码、科学、视觉等多领域刷新 SOTA 基准,面向开发者和企业用户提供极致推理与自动化能力。
GPT-5.6
88A new standard for intelligence and efficiency
OpenAI 发布 GPT-5.6 模型家族,提供旗舰版(Sol)、均衡版(Terra)和轻量版(Luna)三档选择,面向开发者推出程序化工具调用、多智能体并行执行及显式提示缓存等新能力。
Clark
82An AI coworker with its own cloud computer
Clark 是一个拥有独立云端计算机(浏览器、终端、文件、代码环境)的 AI 协作员,用户可以将复杂任务完整交给它异步完成,涵盖研究、代码、文档等多种交付物。
Kimi K3
82The world's first open 3T-class model
Kimi K3 是月之暗面推出的全球首个开源 3T 参数级大模型,具备原生视觉能力和百万 token 上下文窗口,面向代码生成、科学推理等高难度任务场景。
Kimi K3
82The world's first open 3T-class model
Kimi K3 是全球首个开源的3万亿参数级大模型,覆盖编程、知识工作和推理任务,支持原生多模态与100万上下文窗口。
Kimi K3
82Open frontier intelligence: 2.8T params, 1M-token context
Kimi K3 是月之暗面发布的 2.8T 参数开源大语言模型,支持百万 token 上下文窗口和原生视觉能力,面向代码、知识工作和复杂推理场景。
Context.dev
82One API to scrape, enrich, and extract the internet
Context.dev 是一个面向 AI 产品和 Agent 的 Web 上下文 API,通过单一接口提供网页抓取、结构化数据提取、Markdown 转换、截图及公司品牌信息等能力,帮助开发者快速为 AI 应用注入互联网数据。
Sequence Agentic
82Money movement for AI agents
Sequence 是面向 AI Agent 的金融执行层,允许 AI 代理通过 API 真实地发送、拆分和路由资金,同时通过权限隔离、服务端限额和审计日志确保安全可控。
Claude Sonnet 5
82AI that plans, acts, and gets work done
Anthropic 推出的最新 Claude Sonnet 5 模型,专注于 Agentic AI 能力,能够自主规划、执行任务,适用于编程和日常专业工作场景。
Tabstack Browser Automation
82Automate the web in your app or agent, no browser to host
Tabstack 是 Mozilla 推出的浏览器自动化 API,开发者只需一句自然语言即可驱动真实浏览器完成网页操作,无需自行托管浏览器或配置框架。
Skybridge
82The full-stack open source React framework for MCP Apps
Skybridge 是一个开源的全栈 React 框架,专为构建运行在 AI 助手(如 ChatGPT、Claude)内部的 MCP 应用而设计,解决了 MCP 应用开发工具链缺失的问题。
Claude Opus 4.8
82Reasoning model with 1M context for agentic work
Claude Opus 4.8 是 Anthropic 推出的推理型大语言模型,拥有 100 万 token 超长上下文窗口,专为开发者和企业团队处理复杂代码、长周期智能体任务和多日工作流而设计。
NVIDIA Nemotron 3 Ultra
82The first open frontier model built for agents
NVIDIA 发布的 550B 混合专家开源大模型,专为多步骤 AI Agent 任务优化,以开源经济成本实现前沿推理能力。
Nemotron 3 Ultra by NVIDIA
82Powers faster, efficient reasoning for long-running agents
NVIDIA 发布的 550B 参数混合专家开源大模型,专为长时间运行的 AI Agent 优化,相比同类开源前沿模型推理速度提升 5 倍、成本降低 30%。
Spectron
82Agent memory you can trust
Spectron 是一个为 AI Agent 设计的统一记忆基础设施,将图数据库、向量、文档和结构化数据整合在单一 ACID 事务基底上,解决多存储拼接、数据溯源困难和记忆不可信的问题。
Fundraisly
82AI fundraising agent that finds investors and books meetings
Fundraisly 是一款 AI 融资代理工具,帮助创业者从 30 万+投资人数据库中精准匹配活跃投资人、挖掘人脉路径并自动发起冷邮件触达,目标是为每位创始人预约 20-40 场合格投资人会议。
Inkling
78Open weights 975B multimodal model built for fine-tuning
Inkling 是 Thinking Machines 发布的首个开源权重多模态大模型(975B MoE),支持文本、图像和音频的原生推理,开发者可直接下载或在 Tinker 平台上进行微调。
ZooData
78The data layer for AI agents
ZooData 将任意 URL 转化为结构化 JSON 数据,帮助 AI Agent 以更低的 token 成本获取干净的结构化数据,并提供亚马逊和 TikTok 平台的电商竞品与市场洞察能力。
Unabyss for Claude
78Shared memory across all apps and LLMs. In Claude
Unabyss 是一个跨 AI 工具的共享记忆层,让 Claude、GPT、Cursor 等不同 AI 助手能共享同一份用户上下文,解决各 AI 工具「各自为战、互不知情」的碎片化问题。
Graft AI
78Turn company operations into a living map for agents
Graft AI 将企业现有的遗留系统、内部工具和屏幕操作流程转化为结构化的「操作地图」,让 AI 智能体能够稳定、安全地执行企业实际工作流,无需依赖干净的 API 接口。
AgentKey
78One-stop live data marketplace for your agent
AgentKey 是一个一站式实时数据市场插件,让 AI Agent 通过单条命令即可接入搜索、网页、社交、金融、电商、加密货币等多类外部数据源,无需手动集成。
Second Brain for AI v2
78AI memory that connects the dots across every tool
Second Brain for AI v2 是一个开源、自托管的 AI 记忆层,帮助用户在 Claude、ChatGPT、Cursor 等多个 AI 工具之间持久化并智能关联项目、决策和偏好信息,解决跨工具上下文割裂的问题。
FetchSandbox
78API integration testing that remembers what breaks
FetchSandbox 是一个面向开发者和 AI Agent 的 API 集成测试工具,能够模拟 webhook、重试、异步流程和失败场景,帮助在上线前发现并复现真实 bug。
Effects SDK
78AI video & audio effects SDK for real-time apps
Effects SDK 为开发者提供客户端运行的 AI 视频与音频效果 SDK,无需将数据上传至服务器即可实现背景虚化、虚拟背景、智能取景、降噪等实时效果。
Sim
78Open-source workspace for AI agents and workflows
Sim 是一个开源的 AI 智能体工作流构建平台,帮助开发者通过连接 1000+ 集成和多种 LLM 来快速搭建和编排自动化的 AI 工作流。
Auriko
78Trading desk for LLM calls
Auriko 是一个面向开发者的 LLM 调用智能路由平台,通过类量化交易的套利引擎,在多个 AI 推理服务商之间自动选择最优路径,平均降低 30% 的 API 调用成本。
Universal-3.5 Pro
78Native code switching, better diarization, more languages.
AssemblyAI 推出的新一代语音转文字模型,支持18种语言无缝切换、高精度说话人分离,面向开发者提供实时与异步两种API接入方式。
LongCat-2.0
781.6T MoE trained entirely on AI ASICs
LongCat-2.0 是一个开源的 1.6T 参数 MoE 大语言模型,专为编程和智能体工作流优化,支持百万级超长上下文,运行于 AI ASIC 专用硬件之上。
Octolens
78Social listening for the agent era
Octolens 是一个面向 AI 时代的社会监听 API,帮助开发者和企业将 Reddit、Hacker News、播客、新闻等互联网提及数据以结构化 JSON 形式接入 AI Agent、CRM 和数据仓库。
AnySearch
78Real-time structured search trusted by agents and developers
AnySearch 是一个专为 AI Agent 设计的实时结构化搜索工具,解决 Agent 获取信息质量低、来源杂乱的问题,提供经过过滤、去重和结构化的可信数据。
TryCase
78Disposable test environments for AI coding agents
TryCase 为 AI 编程 Agent 提供一次性 Linux 沙箱环境,让 Agent 能自主运行应用、端到端测试变更并返回已验证的代码,无需人工手动测试。
Stigg 2.0
78The usage runtime for AI products
Stigg 2.0 是一个面向 AI 产品的用量运行时层,在请求路径中实时执行计费、权限与治理逻辑,彻底取代事后对账模式。
Gemini Omni Flash
78High-quality video generation and conversational editing
Google 推出的 Gemini Omni Flash 是一款面向开发者的多模态视频生成模型,支持通过文本、图像和视频输入进行高质量视频生成与对话式编辑。
BrowserAct
78Web browser automation for AI agents
BrowserAct 为 AI 智能体提供浏览器自动化层,使其能够在真实网站上执行点击、表单填写、数据提取、登录操作及绕过验证等任务。
Conduit
78Fix the tool-list bloat slowing your AI agent
Conduit 是一个本地 MCP 网关工具,通过将多个 MCP 服务器的工具列表按需路由,减少约 90% 的 token 消耗,解决 AI Agent 因工具列表膨胀导致上下文浪费的问题。
Cloudflare Temporary Accounts
78Let agents deploy before signup
Cloudflare 推出临时账户功能,允许 AI Agent 无需注册即可直接部署 Cloudflare Workers,消除自动化流程中的人工注册障碍。
AgentX
78Evaluate AI agent, pinpoint issues, and fix with one click.
AgentX 是一个面向开发者的 AI Agent 测试与可观测性平台,帮助团队在上线前发现并修复 Agent 问题,类似 AI Agent 领域的 CI/CD 工具链。
Novu Connect
78Ship agents where your users already work
Novu Connect 是一个面向开发者的 AI Agent 多渠道通信基础设施,让 AI Agent 无需自建集成即可通过 Slack、Teams、WhatsApp、Telegram、邮件等渠道与用户进行双向对话。
Kimi K2.7 Code
78Kimi’s most capable coding model yet
Kimi K2.7 Code 是 Moonshot AI 推出的最新编程专用 Agent 模型,支持 256K 超长上下文与多模态输入,主打长链路软件工程任务,推理 token 消耗比上代降低约 30%。
Respan Gateway
78One AI gateway with built-in observability and evals
Respan Gateway 是一个 AI 统一网关平台,通过单一接入点连接 1000+ AI 模型,并内置可观测性、评估、成本控制等能力,解决生产环境中 AI 应用可靠性与多工具碎片化管理的问题。
Claude Fable 5: a Mythos-class1 model
78Anthropic's most capable model, now available to everyone
Claude Fable 5 是 Anthropic 推出的首个 Mythos 级公开大语言模型,通过智能安全路由机制在保持高能力的同时处理风险查询,面向开发者和企业提供强大的代码迁移与 AI 推理能力。
VC Boom
78Score your deck, meet investors who fit, raise more. Boom!
VC Boom 是一款面向创业者的 AI 融资助手,能在 90 秒内评估 pitch deck 并给出改进建议,从 47,000+ 投资人库中匹配最合适的 VC,并自动生成个性化冷邮件,帮助创始人提升融资成功率。
Cleo Atlas Legal API
78The world's regulations, machine-readable.
Cleo Atlas 将全球177个司法管辖区的25.6万条法规转化为机器可读的API,帮助企业快速查询和合规管理跨境监管要求。
Microsoft MAI-Voice-2
78Expressive TTS with voice cloning in 15 languages
微软推出的高表现力语音合成模型,支持短样本声音克隆与15种语言情感控制,面向生产级语音智能体开发者。
Forward
78Installs your API into a customer's codebase in one command
Forward 是一个 AI 前置部署工程师,帮助 API/SDK 公司自动将其接口集成到客户代码库中,用一条命令替代冗长文档,减少注册到首次成功调用之间的流失。
Brief
78Navigate your agents to product-market fit
Brief 是一个为产品团队打造的「活体知识库」,将产品决策、战略意图和执行上下文统一管理,并通过 Chat、Slack、CLI 和 MCP 接口向人类成员和 AI 智能体实时提供相关上下文,防止 AI 在开发过程中「失去方向」。
Agentcard for companies
74Give your agent a debit card
为 AI Agent 提供一次性虚拟借记卡,允许开发者从钱包中划拨固定预算,让 Agent 能够自主完成在线支付,解决 AI 自动化流程中的支付授权与预算控制问题。
Loomal
74Monetize any MCP server in 5 minutes with no % skim.
Loomal 是一个面向 MCP 服务开发者的变现平台,让开发者能在 5 分钟内为 API、工具或数字产品设置付费门槛,由 AI 智能体以 USDC 自动完成支付结算,平台不抽佣。
Constellation Gate AI
74Prompt injection and token savings - #1 in benchmarks
Constellation Gate AI 是一个面向 AI Agent 的安全中间件,无需改动代码即可自动拦截提示注入攻击、扫描敏感信息并压缩 Token 用量,同时将所有决策记录至不可篡改的区块链审计日志。
Opper AI
74The european AI gateway for agents
Opper AI 是一个面向欧洲市场的 AI 网关,提供单一 API 密钥访问 300+ 模型,主打 GDPR 合规、欧盟数据驻留和企业级管控能力,解决欧洲开发者和企业使用 AI 时的数据主权与合规问题。
Mozaik
74TypeScript runtime for self-organizing AI agents
Mozaik 是一个 TypeScript 运行时框架,让 AI 智能体团队能够并发协作、事件驱动通信并在执行过程中动态决定协作方式,解决多智能体系统难以自主组织与协调的问题。
Edgee Claude Code Compressor V2
74Fewer tokens, same context, 50% cost reduction
Edgee Claude Code Compressor V2 是一款面向 AI 编程 Agent 的 token 压缩工具,通过三层压缩技术将上下文 token 用量削减约 50%,在不损失语义的前提下大幅降低 API 调用成本。
RunInfra
74Describe the AI model you need and get an optimized AI
RunInfra 是一个面向开发者的 AI 基础设施平台,用户只需用自然语言描述需求,即可自动生成、优化并部署生产级 AI API,省去繁琐的配置与调优工作。
Humalike
74Give your AI agents the social intelligence they're missing
Humalike 为 AI 智能体提供「社会智能」基础设施,通过 API、模型和基准测试赋予 Agent 类人的社交技能与主动性,填补当前大模型在行为层面的能力空白。
Foresight by Lightning Rod
74Predict anything with AI
Foresight 是一个面向开发者的 AI 预测 API,通过经过真实结果训练和校准的模型,帮助构建智能体、预测市场机器人和决策工具的开发者获取可量化的未来事件预测。
Oxlo.ai
74Scale across AI models without scaling your bill
Oxlo.ai 通过单一 API 接入 35+ 前沿 AI 模型,帮助开发团队在控制成本的前提下灵活切换和比较不同模型,解决 AI 使用账单不可预测的问题。
Latitude
74Fix what's breaking in your AI agent
Latitude 是一个开源 AI Agent 监控平台,自动检测 AI 智能体在规模化运行中的各类失败模式,并为开发者提供修复工具。
Bluerails Discovery
74The rails AI agents use to find and pay you
Bluerails Discovery 帮助品牌提升在 AI 智能体中的可见性,并为其提供接受 AI 代理自动付款的基础设施,解决品牌在 AI 时代被发现和变现的双重问题。
OnBrand by SlideSpeak
74Design context for AI agents
OnBrand 通过 MCP 协议为 AI 智能体提供品牌设计上下文,让 Claude、ChatGPT 等 AI 工具生成的幻灯片和视觉资产真正符合品牌规范,而非千篇一律的通用输出。
Agent 37 Cloud
74Give every customer their own Hermes or OpenClaw agent
Agent 37 是一个为持久化 AI Agent(如 Hermes、OpenClaw、ClaudeCode)提供托管服务的平台,让开发者无需自己维护服务器即可通过一次 API 调用为每个客户部署独立的常驻 Agent。
AI 基础设施 · KOL 观点
Andrej Karpathy 提出了一套完整的 AI 工程方法论,核心是将上下文窗口视为代码(Software 3.0),用工程化思维(规范设计、差异审查、评估循环)替代随意的 Prompt 尝试。他还推广了并行 Agent 管理模式和 CLAUDE.md 配置文件,构建出一套从世界观到具体工具的完整实践体系。
Karpathy 提出了一种基于 LLM 的个人知识库构建模式——'LLM Wiki',核心思路是让 LLM 主动维护一个持久化的 Markdown Wiki,而非每次查询时重新从原始文档检索。每当新增信息源时,LLM 负责提取、整合、更新并标注矛盾点,使知识库随时间累积增值。用户负责信息来源与提问方向,LLM 承担所有整理与交叉引用工作,Obsidian 作为可视化 IDE。
Andrej Karpathy 展示了 AI 自主科研的早期实践:他用约30行代码构建了一个自动化研究智能体 AutoResearch,能够在无人干预的情况下循环执行假设-实验-验证流程,两天内发现约20项互补优化,将训练速度提升11%。这标志着 AI 从执行指令向复现科学方法的跨越,Karpathy 本人也于2026年5月加入 Anthropic 将此方法规模化应用于 Claude 的研究。
Andrej Karpathy 发布了开源项目 autoresearch,一个仅 630 行 Python 代码的自主 AI 研究框架,能在无人干预的情况下一夜完成上百次实验迭代。其核心创新在于让 AI agent 直接修改训练代码而非调参,实现了开放式架构探索。实测结果显示,该系统在 Karpathy 已优化的代码基础上再提速 11%,并发现了人类研究者遗漏的 bug。
Andrej Karpathy 分享了他将 LLM 用于构建个人知识库的完整工作流:通过自动摘要、结构化 wiki 生成、自我修正循环,将碎片化信息转化为可持续增长的知识操作系统。该系统无需 RAG 或向量数据库,最终目标是将知识微调进模型权重。这代表了从「使用 AI 回答问题」到「用 AI 构建知识基础设施」的范式转变。
Karpathy 提出的「循环工程」范式用持续自动化循环替代单次提示,核心是验证器+状态文件+停止条件三件套。其 AutoResearch 项目在2天内运行约700次实验,发现了人工遗漏的改进;Bilevel Autoresearch 在此基础上叠加元循环,同等基准上报告了5倍的收益。
Building Startups for Agents, a 10-Year Opportunity | Greg Isenberg posted on the topic | LinkedIn
88Greg Isenberg认为未来10年最大的创业机会是专为AI Agent构建的基础设施和服务层。他列举了19个具体方向,核心逻辑是:Agent在消费、权限、安全、法律、支付等维度的行为模式与人类截然不同,现有工具无法满足,催生出全新的垂直市场。这与移动互联网时代围绕智能手机建立基础设施的历史路径高度相似。
Karpathy在YC AI创业学校演讲中提出「软件3.0」框架,将LLM类比为操作系统而非商品,强调提示词已成为新的编程语言。他指出AI自动化需满足感知、行动、监督三个前提,并警告从演示到成熟产品之间存在巨大鸿沟,认为这是「代理人的十年」而非一年。
Karpathy提出将笔记视为不可变'源代码'、以LLM为'编译器'构建结构化个人知识库的新范式,用三层架构(原始层/模式层/Wiki层)取代传统RAG的碎片化检索。该框架通过Ingest、Query、Lint三类操作自动维护知识一致性,解决了个人知识管理长期存在的维护成本过高问题,被视为继Vibe Coding和Agentic Engineering之后人机协作的第三个重要范式。
Andrej Karpathy 发布了 nanochat 开源仓库,可在单张 GPU 上以约 100 美元复现完整的 ChatGPT 训练流程(含预训练、微调、RLHF 和聊天 UI),相比 2019 年 GPT-2 原始训练成本(43,000 美元、168 小时)下降了 99%+。文章作者逐行解析了该仓库的技术细节,并指出这标志着'自建 ChatGPT'从比喻变为现实。这一进展发生在美国政府限制 GPT-5.6 出口的同一周,形成鲜明对比。
本文系统介绍了 Andrej Karpathy 提出的 LLM Agent 记忆四分类框架:权重内记忆、上下文记忆、外部检索记忆和 KV 缓存记忆,并结合 Python 代码讲解每种记忆的实现方式。文章兼具理论深度与工程实用性,是构建 AI Agent 记忆系统的高质量参考指南。
Claude Code 的创始人 Boris Cherny 在一个月内提交了 259 个 PR、却未手写一行代码后,彻底卸载了 IDE,转向「循环工程」(Loop Engineering)范式——即构建能自动发现任务、调度执行、判断完成并决定下一步的小型系统。文章详细拆解了循环的三层「蜂巢」架构(本地循环层、云端例程层、集群并行层)和六大核心组件,并指出这一范式并非全新技术,而是 ReAct、AutoGPT 等已有思路的系统化落地。
AI行业的真正瓶颈已从芯片供应转移至电力基础设施,变压器交货期长达128周、电网接入停滞导致大量数据中心项目无法推进。超大规模云厂商正通过20年购电协议(PPA)绑定核能项目,将资产负债表转化为实际创造电力供给的金融工具,这是一场硬件时钟与工业时钟的根本性错位。
Andrej Karpathy 在 AI 创业学校的主题演讲中提出「Software 3.0」概念,认为自然语言正成为新的编程接口,LLM 是一种新型计算机。这一范式转变不仅改变了开发者的工具链,更重新定义了软件本身的构建方式。对开发者、用户和产品设计均有深远影响。
Claude Code创始人Boris Cherny已完全转向自动化Agent工作流,不再手动编写提示词或使用IDE。他通过三层架构(/loop、Routines、动态工作流)实现白天5-10个交互式Agent、夜间数千个并行Agent的规模化运作,核心是让Claude自主编排任务、执行并自我验证结果。文章提供了完整的可复用模板,包括斜杠命令文件、cron表达式和800-Agent并行工作流代码。
Karpathy通过'幽灵'隐喻解释了LLM的本质局限:它们不是从世界中成长的动物,而是从文本库中召唤出的统计幽灵,缺乏真实的情境世界模型。文章以此为基础,构建了Spec、Verifier、Environment三层Agentic AI框架,试图弥补这一根本性缺陷。核心洞察是:LLM的幻觉、锯齿状智能、失忆和易受骗性,都源于它对情境的根本性缺失。
nanochat 2026: Andrej Karpathy's Open-Source "ChatGPT for $100" — Full LLM Pipeline in 8,000 Lines
88Andrej Karpathy 于2025年10月发布 nanochat,一个约8000行 Python+Rust 代码的完整 LLM 训练流水线,涵盖从分词器到推理服务的全链路。其核心主张是用约100美元云GPU费用即可训练出具备真实对话能力的 GPT-2 级别模型,截至2026年6月已获54700个 GitHub Star,成为开源社区最受关注的 LLM 训练教程。
2026年5月标志着AI行业从'补贴时代'转向'Token稀缺时代':GPU价格翻倍,企业AI预算严重超支(Uber四个月耗尽全年预算),各大实验室纷纷从按席位定价转向按用量计费。与此同时,OpenAI年收入达300亿美元,Anthropic年化营收飙升至470亿美元,行业盈利拐点已现。
Andrej Karpathy 在 Sequoia AI Ascent 2026 上提出「Agentic Engineering」概念,认为这是继 Vibe Coding 之后更具工程纪律的 AI 编程范式。他将 2025 年 12 月定义为 AI 编程能力的关键拐点,并以 Software 3.0(prompt 即编程)框架描述大模型作为解释器、上下文窗口作为核心杠杆的新开发方式。
Karpathy 在 Sequoia Ascent 2026 上提出 Software 3.0 框架:LLM 是解释器,上下文窗口就是程序本身,提示词/工具/记忆取代了传统代码。这不是现有开发流程的加速,而是一种范式跃迁——许多原本需要完整应用架构才能解决的问题,现在一个提示词即可完成。对 AI 创业者的核心追问是:哪些软件根本不应该继续以软件形态存在?
Karpathy 在 Sequoia Ascent 演讲中提出 Software 3.0 的概念框架,将 LLM 定义为继显式代码(1.0)和训练权重(2.0)之后的第三个可编程层,核心组成为提示词、智能体、工具、记忆与验证。他将 2025 年 12 月标记为 AI 智能体从演示走向实际生产的拐点。其核心判断是:下一代 AI 原生公司的竞争壁垒不在于 UI 封装,而在于谁拥有最强的验证闭环。
一个3人开发团队通过'氛围编程'架构(vibe coding)在生产环境中重建了两款产品,核心策略是:前端用AI生成,后端手写,通过开放API和MCP服务器连接两者。该团队从20人缩减至3人,同时保持甚至提升了交付速度。文章区分了哪些场景适合AI生成代码(展示层),哪些必须人工把控(系统记录层/安全逻辑)。
Karpathy在一场Agent开发者分享中指出,当前AI领域最大的错误是急于构建Agent而忽视底层大模型的夯实。他以2016年World of Bits项目失败为例,强调Demo容易但产品需要十年打磨,并认为真正站在Agent能力前沿的是独立开发者而非大厂,因为没有任何一家公司在Agent领域积累了五年以上。他还建议从神经科学中汲取灵感,把基础能力做扎实,Agent能力会自然涌现。
Karpathy指出,AI Agent性能差距的根源在于'harness'(框架/脚手架)而非模型本身。同一模型在5个不同Agent框架下,基准分数从3.5%到80.1%相差76个百分点。他认为当前行业最大的误区是急于推出Agent产品,却未深入理解底层模型和系统机制。
Andrej Karpathy 提出 LLM 交互范式正在经历第三次重大演变:从网页聊天机器人、桌面应用,进化为具备持久性、异步性、组织级工具和上下文的'团队成员'。这一范式要求底层完成跨工具、集成、计算环境、记忆和安全的系统性工程,使 AI 真正融入团队工作流,而非作为独立功能存在。
Vibe coding(基于LLM的自然语言编程)已引发大规模安全危机:超过2000个应用在公开网络泄露敏感数据,62%的AI生成代码存在漏洞,2026年3月的CVE数量超过2025全年总和。文章梳理了三种主要立场:安全已经失守、这是原型开发的合理代价、以及问题根源在于模型训练目标而非vibe coding本身。
Karpathy 在 Sequoia Ascent 2026 上提出「Agentic Engineering」概念,将其与「Vibe Coding」明确区分:前者是专业工程纪律,后者只是被动接受 AI 生成的代码。核心主张是:AI 时代的优秀开发者不是代码的消费者,而是对 fallible agent 的主动编排者,需要掌握 spec 设计、diff review、eval 设计和安全审查等能力。Karpathy 认为掌握 agentic workflow 的人可能远超传统 10x 工程师的生产力上限。
Anthropic工程师Boris Cherny认为,代码库自动化(lint规则、CI流程、测试套件等)在AI Agent时代的价值被进一步放大——不仅能加速单个开发者的产出,还能让Agent集群整体提效。更重要的是,自动化将原本存在于人脑中的领域知识编码为可执行的基础设施,使新人和非工程师也能从第一天起有效贡献代码。
Greg Isenberg 提出「AI Loop」概念,将自主 AI 代理应用于业务运营层面(而非仅限于产品开发),通过「目标设定→执行→自我评估→循环迭代」的闭环逻辑,实现 SEO 排名提升、广告盈利优化、模型评估调优等业务目标的 24/7 自动化。其核心主张是:只要指标是非黑即白的,AI 代理就能长期自主运行,相当于一个永不休眠、按 token 计费的外包团队。