Karpathy 提出「循环工程」(Loop Engineering)概念,认为构建长时运行 Agent 的核心瓶颈不是模型智能,而是外部框架(Harness)的设计。他给出了包括角色分离、契约先行、状态持久化、自动重启等九条黄金法则,为多日运行的 AI Agent 开发提供了系统性方法论。
AI 数据分析
AI 数据分析、BI、可视化、数据挖掘
AI 数据分析 · 精选产品
ChatGPT Work
82Partner for your most ambitious work
ChatGPT Work 是 OpenAI 面向职场场景推出的 AI 智能体产品,能够跨应用和文件持续执行复杂任务,将用户目标转化为完整的工作成果。
Mira
82AI moderated interviews that read how people feel
Mira 是一款 AI 全流程用户研究平台,通过面部编码、声音情感分析和眼动追踪,在自动化访谈的同时捕捉受访者的情绪与行为,帮助企业获得更深层的消费者洞察。
Context.dev
82One API to scrape, enrich, and extract the internet
Context.dev 是一个面向 AI 产品和 Agent 的 Web 上下文 API,通过单一接口提供网页抓取、结构化数据提取、Markdown 转换、截图及公司品牌信息等能力,帮助开发者快速为 AI 应用注入互联网数据。
Leni
82The world’s most accurate AI for investors
Leni 是一款专为投资专业人士打造的高精度 AI 分析工具,基于 2.1 万条决策追踪和每日亿级数据处理,提供可审计、可溯源的金融级投资分析与估值输出。
Spectron
82Agent memory you can trust
Spectron 是一个为 AI Agent 设计的统一记忆基础设施,将图数据库、向量、文档和结构化数据整合在单一 ACID 事务基底上,解决多存储拼接、数据溯源困难和记忆不可信的问题。
ZooData
78The data layer for AI agents
ZooData 将任意 URL 转化为结构化 JSON 数据,帮助 AI Agent 以更低的 token 成本获取干净的结构化数据,并提供亚马逊和 TikTok 平台的电商竞品与市场洞察能力。
AgentKey
78One-stop live data marketplace for your agent
AgentKey 是一个一站式实时数据市场插件,让 AI Agent 通过单条命令即可接入搜索、网页、社交、金融、电商、加密货币等多类外部数据源,无需手动集成。
Basedash Actions
78The BI tool that does, not just reports.
Basedash 是一款 AI 驱动的 BI 工具,不仅能回答数据问题,还能直接执行数据库写操作和第三方服务调用(如 Stripe、HubSpot),将数据洞察转化为可审批的自动化行动。
Respan Gateway
78One AI gateway with built-in observability and evals
Respan Gateway 是一个 AI 统一网关平台,通过单一接入点连接 1000+ AI 模型,并内置可观测性、评估、成本控制等能力,解决生产环境中 AI 应用可靠性与多工具碎片化管理的问题。
Vaani
78Lip-synced AI dubbing for creators, brands and studios
Vaani 是一款 AI 配音工具,通过克隆原声、保留音乐并实现帧级唇形同步,帮助创作者和品牌以低成本将视频内容本地化为 40+ 种语言。
Cleo Atlas Legal API
78The world's regulations, machine-readable.
Cleo Atlas 将全球177个司法管辖区的25.6万条法规转化为机器可读的API,帮助企业快速查询和合规管理跨境监管要求。
Veltrix AI
78AI finance copilot for cash flow, margins, and growth
Veltrix AI 是一款面向创始人和财务团队的 AI 财务副驾驶,通过连接 QuickBooks、Xero、Shopify 等主流工具,支持用自然语言查询现金流、利润率和业务表现,替代繁琐的电子表格和静态仪表盘。
Databox MCP
78Chat with your business data inside Claude, ChatGPT and more
Databox MCP 让用户通过自然语言在 Claude、ChatGPT 等 AI 工具中直接查询业务数据(收入、营销活动、销售管道等),打通 BI 数据与 AI 对话界面之间的断层。
Agentcard for companies
74Give your agent a debit card
为 AI Agent 提供一次性虚拟借记卡,允许开发者从钱包中划拨固定预算,让 Agent 能够自主完成在线支付,解决 AI 自动化流程中的支付授权与预算控制问题。
Bingeable
74AI agent that turns one prompt into a product tutorial video
Bingeable 是一款面向 SaaS 团队的 AI 视频代理,只需输入一句提示词,即可自动操控真实浏览器完成产品演示流程,并生成带专业配音的教程视频,无需录屏或剪辑团队。
Clusy
74AI notebook platform for modern data science
Clusy 是一个面向数据科学家和研究团队的 AI 原生 Notebook 平台,通过自然语言描述目标即可自动规划工作流、获取数据集、运行并行实验并比较模型,大幅降低 ML 实验的复杂度。
Foresight by Lightning Rod
74Predict anything with AI
Foresight 是一个面向开发者的 AI 预测 API,通过经过真实结果训练和校准的模型,帮助构建智能体、预测市场机器人和决策工具的开发者获取可量化的未来事件预测。
Oxlo.ai
74Scale across AI models without scaling your bill
Oxlo.ai 通过单一 API 接入 35+ 前沿 AI 模型,帮助开发团队在控制成本的前提下灵活切换和比较不同模型,解决 AI 使用账单不可预测的问题。
Latitude
74Fix what's breaking in your AI agent
Latitude 是一个开源 AI Agent 监控平台,自动检测 AI 智能体在规模化运行中的各类失败模式,并为开发者提供修复工具。
BoqCalc
74Bid ready. Risks uncovered. Timeline locked.
BoqCalc 是一款面向建筑工程行业的 AI 投标工具,用户上传工程量清单(BOQ)后,可在 30 分钟内自动生成成本估算、风险分析、施工进度表和现金流预测,大幅压缩传统投标准备时间。
Lium AI
74AI for Complex Data
Lium 是一个面向科学家和分析师的协作式 AI 数据科学平台,允许用户用自然语言提问复杂的真实世界数据集(地理空间、能源、基础设施等),将原本需要数周的工程工作压缩为一次对话。
Minimi
74Your ambient memory for Claude
Minimi 是一款 Mac 端的环境记忆工具,自动捕获用户跨文档、通话、消息和标签页的上下文,并无缝注入 Claude,省去手动粘贴背景信息的步骤。
RankEcho
72Find, fix, and prove your AI search visibility.
RankEcho 帮助企业监控并提升品牌在 ChatGPT、Perplexity 等 AI 搜索引擎中的引用可见度,形成发现问题、修复差距、验证效果的完整闭环。
NeuroVidz
72See how a brain reacts to your clip
NeuroVidz 通过模拟大脑对视觉和音频的反应,为视频/音频内容创作者提供逐秒情绪时间线和编辑建议,解决内容吸引力难以量化的问题。
Guidance
72MRP, COGS & traceability for CPG brands — no consultants
Guidance 是专为中小型 CPG 品牌设计的运营管理软件,通过对话式配置替代昂贵的 ERP 实施,提供实时 COGS、批次追溯、有机质量平衡和 MRP 功能。
CitedSpy
72Track your brand in ChatGPT, Claude, Perplexity and More
CitedSpy 帮助品牌监控并提升其在 ChatGPT、Claude、Perplexity 等 AI 搜索引擎中的曝光度与引用率,解决品牌在 AI 时代的可见性问题。
AgentGrid
72Your AI agents team, terminals, notes: one infinite canvas
AgentGrid 是一款面向开发者的 AI 编码代理协作工作台,将多个角色化 AI 代理(构建、QA、审查、DevOps)、终端、浏览器、笔记和 Git 整合在一块持久化无限画布上,让开发者可以可视化地监督和调度 AI 协作完成完整的软件构建流程。
RankSurf
72The AI visibility tool that gets you cited, not just tracked
RankSurf 是一款 AI 可见性优化工具,帮助品牌监测并提升在 ChatGPT、Perplexity、Google AI Overview 等 AI 平台中的被引用率,解决企业在 AI 搜索时代被竞争对手抢占推荐位的问题。
isvisible.ai?
72Free AI visibility audit
isvisible.ai 是一款免费的 AI 可见性审计工具,帮助网站主检测其网站是否能被 ChatGPT、Claude、Perplexity 等主流 AI 系统爬取和访问,并生成 0-100 的可访问性评分。
Basedash Suggestions
72Your AI data analyst, now with ideas of its own.
Basedash 是一款 AI 数据分析工具,能主动研究用户数据和历史行为,自动生成个性化的分析建议、仪表板方案和自动化任务,消除数据分析中的「空白页」困境。
Cited
72AI search visibility for B2B SaaS. Track, fix, win.
Cited 是一款面向 B2B SaaS 企业的 AI 搜索可见性追踪工具,帮助企业监测并提升其品牌在 ChatGPT、Claude 等 AI 工具中被推荐的频率与排名,从而赢得更多潜在客户。
ARA
72Give AI systems a memory of every decision they make
ARA 是一个 ML 模型决策记录与回放的基础设施层,解决 AI 系统「决策后即遗忘」的问题,支持事后调试、漂移检测和无泄漏训练数据回溯。
Inbix
72Cloudflare-native Email Infrastructure for Developers
Inbix 是一个基于 Cloudflare 的开源开发者邮件基础设施平台,专为测试、CI/CD 流程和 AI 工作流提供可编程临时收件箱与 Webhook 自动化能力。
Crustdata Recruiter
72Claude Skills to turn Claude into a 100x Recruiter
Crustdata Recruiter 是一套运行在 Claude 上的招聘技能插件,通过接入超10亿候选人数据库,让 AI 像资深招聘官一样搜索、排名、解释候选人并自动起草外联邮件。
ShipMore
72Turn any CSV into an agent-operable, revenue-ready product
ShipMore 将任意 CSV 文件一键转化为可变现的数据产品(目录站、研究数据库、API 或数据订阅),内置搜索、Stripe 支付和 SEO 页面,并支持 AI Agent 自动化运营。
Orbis AI
72Local-first AI that turns prompts into real designs
Orbis AI 是一款本地运行的 AI 设计工具,能将自然语言描述直接转化为可交互的 React + Tailwind 生产代码,并支持导出到 Figma,解决设计师和开发者之间的协作效率问题。
Aurora
72Glass-box Quantitative AI for Humans and Agents
Aurora 是一款本地运行的透明化定量 AI 工具,通过 24+ 种研究级统计方法对数据集进行异常检测、因果分析、预测等计算,并确保每项结论可溯源、零数据捏造,同时提供 MCP 服务器和 Python SDK 供 AI 智能体调用。
AI Visibility
72Check how ChatGPT, Gemini and Claude talk about your brand
AI Visibility 帮助品牌监测自己在 ChatGPT、Gemini、Claude 等主流 AI 助手中的曝光情况,并提供优化建议以提升 AI 搜索时代的品牌可见度。
Calnode
72Self-hostable Calendly + Zoom, in one Go binary
Calnode 是一个可自托管的开源日程预约 + 视频会议一体化工具,用单个 Go 二进制文件替代 Calendly 和 Zoom,让用户以极低成本完全掌控自己的数据。
GeoMagics.com
72Measure, optimize and predict AI visibility.
GeoMagics 帮助企业监测和优化品牌在 ChatGPT、Claude、Gemini 等 AI 问答引擎中的曝光与表现,解决传统 SEO 工具无法覆盖 AI 时代搜索可见性的问题。
Just Ask by SEORCE
72Talk to your SEO & AI Visibility data on WhatsApp.
SEORCE 让用户通过 WhatsApp 与 SEO、AI 可见性、分析和外链数据直接对话,用自然语言提问代替传统仪表盘操作,解决 SEO 工具使用门槛高、信息获取繁琐的问题。
Compendium
72Keeping your team, agents, and data on one page
Compendium 是一个面向团队的 AI 代理共享记忆平台,让多个 AI 代理和团队成员共用同一上下文与知识库,解决多智能体协作中信息孤岛的问题。
Zoho Tables
72Smarter way to manage work and data.
Zoho Tables 是一款融合电子表格与数据库的无代码平台,借助 AI 能力帮助团队组织数据、自动化工作流并实时协作。
DEHY
72Real-time SEC filing intelligence, queryable from AI
DEHY 是一款面向金融分析师的实时 SEC 文件智能查询工具,支持通过 AI 对内部人交易、机构持仓、8-K 公告等监管文件进行亚60秒级别的实时检索与分析。
Pilotbase
72Universal database GUI for SQL, NoSQL, and vector DBs
Pilotbase 是一个开源的通用数据库 GUI 工具,支持 19+ 种 SQL、NoSQL 和向量数据库,并内置 AI 代理,让用户用自然语言查询数据库。
Analyse
72Analytics, AI SEO content & a data copilot in one
Analyse 是一款集网站分析、AI SEO 内容生成与数据副驾驶于一体的 SaaS 工具,帮助中小网站团队用一个订阅替代分析工具、SEO 工具和内容外包服务。
Termi Protocol
72Watch your AI coding agents build, live in 3D
Termi Protocol 将 AI 编程 Agent 的工作流程以 3D 游戏化方式实时可视化,让用户像看游戏角色一样观察 AI Agent 的读写和命令执行过程。
chokepoints.ai
72Mapping the end to end AI supply chain.
一个可交互的 AI 供应链全景图谱,覆盖从原材料到应用层的十个层次、17500+ 家公司,帮助用户识别 AI 基础设施中的关键卡脖子节点。
valv
72Give AI agents safe, scoped access to your database
valv 为 AI 智能体提供细粒度的数据库访问控制,通过按用户动态授权替代传统的全权限数据库连接,防止数据越权访问。
Rhythmic
72Spatial product management tool built for MCP and AI agents
Rhythmic 是一款面向现代软件团队的空间化项目管理平台,支持在无限画布上进行可视化规划,并原生集成 MCP 协议,让人类与 AI 智能体能在同一工作空间协同完成项目管理任务。
adsideō
72Ambient AI layer that works before you ask
Adsideo 是一个环境感知 AI 层,无需主动提问即可理解用户屏幕、会议、写作和代码的实时上下文,自动完成创建任务、起草内容、修复问题等操作。
Claude Science
72Your research partner for rigorous science
Claude Science 是一款面向科研人员的 AI 工作台,能够像专业科学家一样执行分析并追踪每一步骤,帮助研究者减少流程拼接的时间,专注于科学研究本身。
MailAdept by mailwarm
72AI Agents & Email deliverability experts on your team
MailAdept 是一款 AI 驱动的邮件送达率托管服务,结合 AI Agent 与人工专家,帮助企业自动审计邮件基础设施、修复投递问题、提升收件箱落地率。
Acti
72Agentic keyboard for mobile commands and search
Acti 是一款移动端 AI 智能键盘,用户长按触发栏即可通过自然语言完成搜索、应用操作和自定义工作流,无需离开当前对话界面。
Skills Marketplace by Databox
72Ready-made AI analytics skills for your business data
Databox 推出的 AI 分析技能市场,提供即用型技能模板,自动拉取业务实时数据并在一分钟内生成可分享的分析报告,支持在 Claude 对话或 n8n 自动化工作流中使用。
QApilot's CoWork
723x Mobile Automation. Same QE Team.
QApilot CoWork 是一款 AI 驱动的移动端自动化测试工具,能将现有测试用例转化为可在 iOS、Android 和 Flutter 真机上执行的自动化脚本,帮助 QA 团队将移动测试效率提升 3 倍。
Basedash for Excel
72Turn any Excel file into a live dashboard
Basedash for Excel 让用户将 Excel 文件直接转化为实时仪表盘,通过 AI 自动分析数据并生成图表,无需编写公式或透视表,同时支持将图表数据导出回 xlsx 格式。
codesynapse
72Code graph as MCP tools makes your AI stops hallucinating
codesynapse 将代码库索引为真实代码图谱并通过32个MCP工具暴露给AI,解决AI编程助手因缺乏代码上下文而产生幻觉的问题。
Heron
72Wireshark for AI Agents: passive eBPF observability
Heron 是一个基于 eBPF 的 AI 智能体网络流量被动监控工具,无需修改代码或引入代理,即可解密并还原 AI Agent 实际发出的 LLM 调用,解决 AI Agent 行为不透明的可观测性问题。
Propane
72Automatic customer context for product teams and agents
Propane 为产品团队和 AI 智能体自动聚合所有工具中的客户上下文,提供统一、实时的客户视图,并可直接提交给编码或设计智能体使用。
AI 数据分析 · KOL 观点
Andrej Karpathy 提出了一套完整的 AI 工程方法论,核心是将上下文窗口视为代码(Software 3.0),用工程化思维(规范设计、差异审查、评估循环)替代随意的 Prompt 尝试。他还推广了并行 Agent 管理模式和 CLAUDE.md 配置文件,构建出一套从世界观到具体工具的完整实践体系。
Anthropic的Claude Code创始人Boris Cherny披露,他已8个月未亲手写过一行代码,完全依靠管理数千个AI Agent完成软件开发工作。截至2026年5月,超过80%合并进Anthropic代码库的代码由Claude自主撰写,代码产出量较年初增长8倍。更值得关注的是,该系统已开始自主浏览GitHub和X寻找下一步构建方向,递归自我改进正在成为现实。
Anthropic 公开了其内部 AI 辅助编程的规模化数据:截至2026年5月,Claude 已负责超过80%的生产代码提交,工程师人均代码产出提升8倍,开放性任务成功率达76%(半年内提升50个百分点)。这是业界首份来自前沿实验室的、基于真实生产环境的 Agentic 编程规模化原始数据报告,而非基准测试或演示。文章提炼了可供工程团队直接参考的工作流模式,如 maker-checker 循环等。
Karpathy 提出了一种基于 LLM 的个人知识库构建模式——'LLM Wiki',核心思路是让 LLM 主动维护一个持久化的 Markdown Wiki,而非每次查询时重新从原始文档检索。每当新增信息源时,LLM 负责提取、整合、更新并标注矛盾点,使知识库随时间累积增值。用户负责信息来源与提问方向,LLM 承担所有整理与交叉引用工作,Obsidian 作为可视化 IDE。
Andrej Karpathy 展示了 AI 自主科研的早期实践:他用约30行代码构建了一个自动化研究智能体 AutoResearch,能够在无人干预的情况下循环执行假设-实验-验证流程,两天内发现约20项互补优化,将训练速度提升11%。这标志着 AI 从执行指令向复现科学方法的跨越,Karpathy 本人也于2026年5月加入 Anthropic 将此方法规模化应用于 Claude 的研究。
Andrej Karpathy 发布了开源项目 autoresearch,一个仅 630 行 Python 代码的自主 AI 研究框架,能在无人干预的情况下一夜完成上百次实验迭代。其核心创新在于让 AI agent 直接修改训练代码而非调参,实现了开放式架构探索。实测结果显示,该系统在 Karpathy 已优化的代码基础上再提速 11%,并发现了人类研究者遗漏的 bug。
Andrej Karpathy 分享了他将 LLM 用于构建个人知识库的完整工作流:通过自动摘要、结构化 wiki 生成、自我修正循环,将碎片化信息转化为可持续增长的知识操作系统。该系统无需 RAG 或向量数据库,最终目标是将知识微调进模型权重。这代表了从「使用 AI 回答问题」到「用 AI 构建知识基础设施」的范式转变。
Andrej Karpathy 记录了自己在2025年底几周内工作流从80%手写代码转变为80%由AI生成代码的亲身经历,提出「英语是最热门的新编程语言」。他不仅分析了AI编码的局限性(过度假设、代码臃肿、不主动澄清歧义),更指出AI真正的魔法在于「韧性」——能在闭环中不知疲倦地反复尝试直至达成目标,这正是大多数AGI体感的来源。他建议开发者从命令式思维转向声明式思维,给AI明确的成功标准而非逐步指令。
Karpathy 提出的「循环工程」范式用持续自动化循环替代单次提示,核心是验证器+状态文件+停止条件三件套。其 AutoResearch 项目在2天内运行约700次实验,发现了人工遗漏的改进;Bilevel Autoresearch 在此基础上叠加元循环,同等基准上报告了5倍的收益。
Building Startups for Agents, a 10-Year Opportunity | Greg Isenberg posted on the topic | LinkedIn
88Greg Isenberg认为未来10年最大的创业机会是专为AI Agent构建的基础设施和服务层。他列举了19个具体方向,核心逻辑是:Agent在消费、权限、安全、法律、支付等维度的行为模式与人类截然不同,现有工具无法满足,催生出全新的垂直市场。这与移动互联网时代围绕智能手机建立基础设施的历史路径高度相似。
Karpathy警告AI行业,当前Agent热潮存在重蹈OpenAI五年弯路的风险。其核心论点是:Agent能力的天花板取决于底层基础模型的质量,在基础模型尚未成熟时强推Agent只会导致失败。Anthropic和OpenAI在AI4S领域的最新布局,恰好印证了这一判断——两者都在用工作流和生态整合来弥补基础模型的结构性不足。
AI领域顶级研究者卡帕西(Andrej Karpathy)正式加入Anthropic,负责利用Claude加速预训练研究,核心方向为递归自我改进(RSI)。文章梳理了RSI从学术概念走向工程实践的进展,包括Anthropic内部基准数据和行业竞速态势。同时直面安全悖论:一家以AI安全为立身之本的公司,正在主动推进被安全社区视为高风险的能力方向。
Karpathy在YC AI创业学校演讲中提出「软件3.0」框架,将LLM类比为操作系统而非商品,强调提示词已成为新的编程语言。他指出AI自动化需满足感知、行动、监督三个前提,并警告从演示到成熟产品之间存在巨大鸿沟,认为这是「代理人的十年」而非一年。
Karpathy提出将笔记视为不可变'源代码'、以LLM为'编译器'构建结构化个人知识库的新范式,用三层架构(原始层/模式层/Wiki层)取代传统RAG的碎片化检索。该框架通过Ingest、Query、Lint三类操作自动维护知识一致性,解决了个人知识管理长期存在的维护成本过高问题,被视为继Vibe Coding和Agentic Engineering之后人机协作的第三个重要范式。
Greg Isenberg 提出「AI Agent 即新 SaaS」的核心论点:软件正从辅助工作转变为直接完成工作,创业者应将某个具体岗位的工作流打包成服务出售,定价逻辑对标劳动力而非软件授权。他给出了一套完整打法:锁定带薪工作流、深度跟岗观察、构建最小可用 Agent、以试点形式销售,再逐步产品化。文章以 Slang AI、Same Day 为真实案例,并附 30 天从零启动计划。
Claude Code凭借软件领域独有的可验证奖励机制(编译器+测试套件)实现了强化学习的突破,成为史上最快达到十亿美元年化营收的软件产品。文章核心论点是:代码之所以率先被AI攻克,不是因为编程简单,而是因为它是极少数拥有客观评分函数的知识工作领域。这一结构性优势正在向其他行业蔓延,关键在于谁能为下一个领域构建'答案钥匙'。
Andrej Karpathy 发布了 nanochat 开源仓库,可在单张 GPU 上以约 100 美元复现完整的 ChatGPT 训练流程(含预训练、微调、RLHF 和聊天 UI),相比 2019 年 GPT-2 原始训练成本(43,000 美元、168 小时)下降了 99%+。文章作者逐行解析了该仓库的技术细节,并指出这标志着'自建 ChatGPT'从比喻变为现实。这一进展发生在美国政府限制 GPT-5.6 出口的同一周,形成鲜明对比。
本文系统介绍了 Andrej Karpathy 提出的 LLM Agent 记忆四分类框架:权重内记忆、上下文记忆、外部检索记忆和 KV 缓存记忆,并结合 Python 代码讲解每种记忆的实现方式。文章兼具理论深度与工程实用性,是构建 AI Agent 记忆系统的高质量参考指南。
AI购物代理(如ChatGPT、Perplexity)正在真实下单,Adobe数据显示AI来源流量在2026年Q1同比增长393%,转化率比自然流量高42%。文章提供了一份六大支柱自评清单(产品数据流、结构化数据、协议集成、机器可读政策、信任信号、AI引用),帮助商家诊断自身对AI代理的可见性与可交易性。当前仅3%的交易通过AI代理完成,但72%的商家承认消费者接受速度将超过自身准备速度,窗口期正在关闭。
Anthropic Claude Code负责人Boris Cherny在Meta @Scale大会上提出,AI编码正进入第三阶段:由Agent互相调用Agent来完成代码编写,形成持续运行的递归循环结构。这种'loop'模式颠覆了传统的'启动-检查-停止'工作流,子Agent会持续在后台监控代码库、提交PR,直到收到终止信号,Cherny本人已在日常开发中运行此类持久化子Agent。
Claude Code 的创始人 Boris Cherny 在一个月内提交了 259 个 PR、却未手写一行代码后,彻底卸载了 IDE,转向「循环工程」(Loop Engineering)范式——即构建能自动发现任务、调度执行、判断完成并决定下一步的小型系统。文章详细拆解了循环的三层「蜂巢」架构(本地循环层、云端例程层、集群并行层)和六大核心组件,并指出这一范式并非全新技术,而是 ReAct、AutoGPT 等已有思路的系统化落地。
AI行业的真正瓶颈已从芯片供应转移至电力基础设施,变压器交货期长达128周、电网接入停滞导致大量数据中心项目无法推进。超大规模云厂商正通过20年购电协议(PPA)绑定核能项目,将资产负债表转化为实际创造电力供给的金融工具,这是一场硬件时钟与工业时钟的根本性错位。
Andrej Karpathy 在 AI 创业学校的主题演讲中提出「Software 3.0」概念,认为自然语言正成为新的编程接口,LLM 是一种新型计算机。这一范式转变不仅改变了开发者的工具链,更重新定义了软件本身的构建方式。对开发者、用户和产品设计均有深远影响。
Karpathy通过'幽灵'隐喻解释了LLM的本质局限:它们不是从世界中成长的动物,而是从文本库中召唤出的统计幽灵,缺乏真实的情境世界模型。文章以此为基础,构建了Spec、Verifier、Environment三层Agentic AI框架,试图弥补这一根本性缺陷。核心洞察是:LLM的幻觉、锯齿状智能、失忆和易受骗性,都源于它对情境的根本性缺失。
Claude Code 创始人 Boris Cherny 描述了他编程方式的最新演变:从使用 IDE 到提示 Claude,再到如今编写自动化循环让系统自主与 Claude 交互、评估输出并迭代。他认为这代表了软件开发的下一层抽象,人类角色从执行者转变为编排者,预计这一转变将在未来数月内成为主流。
2026年5月标志着AI行业从'补贴时代'转向'Token稀缺时代':GPU价格翻倍,企业AI预算严重超支(Uber四个月耗尽全年预算),各大实验室纷纷从按席位定价转向按用量计费。与此同时,OpenAI年收入达300亿美元,Anthropic年化营收飙升至470亿美元,行业盈利拐点已现。
Claude Code 的创造者 Boris Cherny 认为,随着 AI 编程能力的成熟,'软件工程师'这一职位将逐渐消失,取而代之的是'构建者'(Builder)——一种以 AI 为中心、以判断力和目标感驱动的工作角色。黑客马拉松的结果表明,非技术背景的人(电工、医生、木匠)借助 AI 代理反而胜过专业工程师,说明真正稀缺的能力是'知道自己要构建什么'。他以1990年代企业采用个人电脑的历史为鉴,强调只有将 AI 置于工作流核心的组织才能获得真正的生产力提升。
Salesforce 使用 Claude Code Agents 将原本需要 231 天的代码迁移任务压缩至 13 天完成,同期 PR 数量上升但系统故障率反降 5%。这打破了'效率与质量不可兼得'的传统认知,核心在于将安全护栏和质量标准直接内嵌于 Agent 工作流中。作者强调,AI 真正的价值不在于加速现有流程,而在于重构工作方式、消除不必要的环节和交接。
Claude Code创始人Boris Cherny分享了AI编程工具如何重塑软件工程的核心洞察:工程师角色已从写代码转向编排AI工作流,Anthropic内部人均生产力提升200%,新工程师上手时间从数周缩短至两天。他预言通才工程师的黄金时代已到来,甚至对'品味'这一被认为是人类持久优势的东西提出了质疑。