← 返回首页
AI Agent

AI Agent

自主智能体、多 Agent 协作、Agentic Workflow 与 Computer Use

658 个产品 282 条观点

AI Agent · 精选产品

GPT-5.6

88

A new standard for intelligence and efficiency

OpenAI 发布 GPT-5.6 模型家族,提供旗舰版(Sol)、均衡版(Terra)和轻量版(Luna)三档选择,面向开发者推出程序化工具调用、多智能体并行执行及显式提示缓存等新能力。

▲ 274 paid

Clark

82

An AI coworker with its own cloud computer

Clark 是一个拥有独立云端计算机(浏览器、终端、文件、代码环境)的 AI 协作员,用户可以将复杂任务完整交给它异步完成,涵盖研究、代码、文档等多种交付物。

▲ 441 freemium

Verse

82

Build and hire autonomous AI employees from a single prompt

Verse 让用户通过一句提示词即可创建并「雇用」具备完整数字身份和工具能力的自主 AI 员工,代替人类 24/7 独立完成工作任务。

▲ 105 freemium

ChatGPT Work

82

Partner for your most ambitious work

ChatGPT Work 是 OpenAI 面向职场场景推出的 AI 智能体产品,能够跨应用和文件持续执行复杂任务,将用户目标转化为完整的工作成果。

▲ 190 freemium

Coasty

82

A Computer-Use-Agent that runs legacy software like a human

Coasty 是一个计算机操控 AI 代理,能像人类一样自主操作桌面软件(无需 API),主要解决医疗、保险、税务等行业中遗留系统自动化难题。

▲ 131 paid

Context.dev

82

One API to scrape, enrich, and extract the internet

Context.dev 是一个面向 AI 产品和 Agent 的 Web 上下文 API,通过单一接口提供网页抓取、结构化数据提取、Markdown 转换、截图及公司品牌信息等能力,帮助开发者快速为 AI 应用注入互联网数据。

▲ 251 freemium

Sequence Agentic

82

Money movement for AI agents

Sequence 是面向 AI Agent 的金融执行层,允许 AI 代理通过 API 真实地发送、拆分和路由资金,同时通过权限隔离、服务端限额和审计日志确保安全可控。

▲ 202 freemium

Claude Sonnet 5

82

AI that plans, acts, and gets work done

Anthropic 推出的最新 Claude Sonnet 5 模型,专注于 Agentic AI 能力,能够自主规划、执行任务,适用于编程和日常专业工作场景。

▲ 304 freemium

Tabstack Browser Automation

82

Automate the web in your app or agent, no browser to host

Tabstack 是 Mozilla 推出的浏览器自动化 API,开发者只需一句自然语言即可驱动真实浏览器完成网页操作,无需自行托管浏览器或配置框架。

▲ 314 unknown

Cursor for iOS

82

Build with coding agents from anywhere

Cursor 推出 iOS 原生应用,让开发者可以随时随地通过手机启动云端 AI 编程 Agent、监控任务进度并合并 PR,打破本地机器的时空限制。

▲ 467 freemium

Framer 3.0

82

With Agents, Branching, Community, and an all-new design

Framer 3.0 是一款面向设计师和团队的 AI 驱动网站构建工具,通过引入 AI Agents、分支协作和社区变现机制,让团队能更高效地设计、迭代和发布网站。

▲ 419 freemium

Claude Opus 4.8

82

Reasoning model with 1M context for agentic work

Claude Opus 4.8 是 Anthropic 推出的推理型大语言模型,拥有 100 万 token 超长上下文窗口,专为开发者和企业团队处理复杂代码、长周期智能体任务和多日工作流而设计。

▲ 5 paid

NVIDIA Nemotron 3 Ultra

82

The first open frontier model built for agents

NVIDIA 发布的 550B 混合专家开源大模型,专为多步骤 AI Agent 任务优化,以开源经济成本实现前沿推理能力。

▲ 6 freemium

Nemotron 3 Ultra by NVIDIA

82

Powers faster, efficient reasoning for long-running agents

NVIDIA 发布的 550B 参数混合专家开源大模型,专为长时间运行的 AI Agent 优化,相比同类开源前沿模型推理速度提升 5 倍、成本降低 30%。

▲ 153 free

Spectron

82

Agent memory you can trust

Spectron 是一个为 AI Agent 设计的统一记忆基础设施,将图数据库、向量、文档和结构化数据整合在单一 ACID 事务基底上,解决多存储拼接、数据溯源困难和记忆不可信的问题。

▲ 157 unknown

Fundraisly

82

AI fundraising agent that finds investors and books meetings

Fundraisly 是一款 AI 融资代理工具,帮助创业者从 30 万+投资人数据库中精准匹配活跃投资人、挖掘人脉路径并自动发起冷邮件触达,目标是为每位创始人预约 20-40 场合格投资人会议。

▲ 918 paid

Skippr AI

78

The live AI employee inside your product, serving every user

Skippr AI 是一个嵌入式 AI 员工平台,通过实时语音、视觉和浏览器自动化操作,帮助 SaaS 产品自动完成用户引导、激活和问题解决,无需人工干预。

▲ 314 freemium

ZooData

78

The data layer for AI agents

ZooData 将任意 URL 转化为结构化 JSON 数据,帮助 AI Agent 以更低的 token 成本获取干净的结构化数据,并提供亚马逊和 TikTok 平台的电商竞品与市场洞察能力。

▲ 545 freemium

Graft AI

78

Turn company operations into a living map for agents

Graft AI 将企业现有的遗留系统、内部工具和屏幕操作流程转化为结构化的「操作地图」,让 AI 智能体能够稳定、安全地执行企业实际工作流,无需依赖干净的 API 接口。

▲ 118 freemium

River

78

AI account executives that demo and close B2B deals

River 是一款 AI 销售代表产品,能够在 B2B 潜在客户询盘时立即接入通话、完成产品演示并处理异议直至成交,解决销售团队日历排期导致的线索流失问题。

▲ 203 paid

Agently

78

Your whole stack, running itself!

Agently 是一个企业级 AI 自动化平台,通过 100+ 连接器将 Stripe、Slack、Linear 等工具整合为统一的智能大脑,自动感知事件并端到端完成跨系统任务,无需人工干预。

▲ 283 freemium

ClawTeams

78

The first goal-driven, proactive AI team for e-commerce

ClawTeams 是一个面向电商卖家的 AI 员工平台,用户只需设定目标,AI 团队自动分解任务、协调执行,无需微管理。

▲ 538 freemium

NoMac.app

78

The headless iOS app publishing pipeline for AI agents.

NoMac 是一个面向 AI 代理的无头 iOS 应用发布流水线,让开发者无需 Mac 或 Xcode,直接通过 Claude、Codex 或 Cursor 等 AI 代理完成 iOS 应用的构建、签名、TestFlight 推送和 App Store 提交。

▲ 127 freemium

AgentKey

78

One-stop live data marketplace for your agent

AgentKey 是一个一站式实时数据市场插件,让 AI Agent 通过单条命令即可接入搜索、网页、社交、金融、电商、加密货币等多类外部数据源,无需手动集成。

▲ 462 freemium

Osaurus

78

Open source agents that run 100% locally on your Mac

Osaurus 是一个完全本地运行的 macOS 原生 AI Agent 框架,让用户无需联网即可在 Mac 上运行任意 AI 模型并实现自主任务执行,同时保护隐私数据不离开本地。

▲ 465 free

FetchSandbox

78

API integration testing that remembers what breaks

FetchSandbox 是一个面向开发者和 AI Agent 的 API 集成测试工具,能够模拟 webhook、重试、异步流程和失败场景,帮助在上线前发现并复现真实 bug。

▲ 336 freemium

Miora

78

Scale your creativity on editable canvas with agent memory

Miora 是一个具备记忆能力的 AI 创意工作室,允许用户在可编辑画布上生成多模态创意资产,并将创作风格沉淀为可复用的「技能」,让一个人拥有整个创意团队的产出能力。

▲ 380 freemium

Sim

78

Open-source workspace for AI agents and workflows

Sim 是一个开源的 AI 智能体工作流构建平台,帮助开发者通过连接 1000+ 集成和多种 LLM 来快速搭建和编排自动化的 AI 工作流。

▲ 453 freemium

Timbal AI

78

Build AI agents, workflows, and apps in one stack

Timbal AI 是一个一站式 AI 应用开发平台,帮助团队将 AI 原型快速落地为生产级系统,整合了 Agent 构建、工作流编排、数据连接、界面设计、部署监控与治理等全链路能力。

▲ 408 freemium

LongCat-2.0

78

1.6T MoE trained entirely on AI ASICs

LongCat-2.0 是一个开源的 1.6T 参数 MoE 大语言模型,专为编程和智能体工作流优化,支持百万级超长上下文,运行于 AI ASIC 专用硬件之上。

▲ 141 free

Katalyst

78

The AI agent that works your Salesforce Pipeline

Katalyst 是一款深度集成 Salesforce 的 AI 销售智能体,自动完成通话记录整理、CRM 字段更新、跟进邮件起草及商机风险预警,帮助企业销售团队消除手动数据录入负担并提升管道管理效率。

▲ 306 paid

Badge

78

AI agents collect peer reviews to generate proof of work

Badge 是一款 AI 驱动的职场信任评分工具,通过自动收集同事匿名评价,为求职者生成可携带的工作证明,同时帮助招聘方在 30 秒内完成背景调查。

▲ 408 freemium

Octolens

78

Social listening for the agent era

Octolens 是一个面向 AI 时代的社会监听 API,帮助开发者和企业将 Reddit、Hacker News、播客、新闻等互联网提及数据以结构化 JSON 形式接入 AI Agent、CRM 和数据仓库。

▲ 315 freemium

AnySearch

78

Real-time structured search trusted by agents and developers

AnySearch 是一个专为 AI Agent 设计的实时结构化搜索工具,解决 Agent 获取信息质量低、来源杂乱的问题,提供经过过滤、去重和结构化的可信数据。

▲ 432 freemium

TryCase

78

Disposable test environments for AI coding agents

TryCase 为 AI 编程 Agent 提供一次性 Linux 沙箱环境,让 Agent 能自主运行应用、端到端测试变更并返回已验证的代码,无需人工手动测试。

▲ 165 freemium

Osloq

78

An AI agent that reproduces GitHub issues for you

Osloq 是一个 AI Agent,自动在真实沙箱环境中复现 GitHub Issue 中的 Bug,为开发者提供有证据支撑的复现报告,省去手动排查步骤。

▲ 200 freemium

Basedash Actions

78

The BI tool that does, not just reports.

Basedash 是一款 AI 驱动的 BI 工具,不仅能回答数据问题,还能直接执行数据库写操作和第三方服务调用(如 Stripe、HubSpot),将数据洞察转化为可审批的自动化行动。

▲ 74 freemium

Needle

78

The proactive GTM agent in Slack and Teams

Needle 是一个主动式 GTM AI 销售代理,嵌入 Slack/Teams,自动监控销售管道、识别停滞商机并发起跟进动作,替代人工管理 CRM 和销售流程。

▲ 129 freemium

Agent Mode by Receiptor AI

78

Bookkeeping assistant that runs receipt workflows end-to-end

Receiptor AI 是一款基于 AI Agent 的自动化记账助手,能够端到端处理收据工作流——从收件箱和手机采集收据、整理归档到云端或会计软件,并与银行交易自动匹配,解决中小企业和个人财务管理中繁琐的收据整理问题。

▲ 364 freemium

BrowserAct

78

Web browser automation for AI agents

BrowserAct 为 AI 智能体提供浏览器自动化层,使其能够在真实网站上执行点击、表单填写、数据提取、登录操作及绕过验证等任务。

▲ 332 freemium

Conduit

78

Fix the tool-list bloat slowing your AI agent

Conduit 是一个本地 MCP 网关工具,通过将多个 MCP 服务器的工具列表按需路由,减少约 90% 的 token 消耗,解决 AI Agent 因工具列表膨胀导致上下文浪费的问题。

▲ 128 free

Cloudflare Temporary Accounts

78

Let agents deploy before signup

Cloudflare 推出临时账户功能,允许 AI Agent 无需注册即可直接部署 Cloudflare Workers,消除自动化流程中的人工注册障碍。

▲ 161 freemium

AgentX

78

Evaluate AI agent, pinpoint issues, and fix with one click.

AgentX 是一个面向开发者的 AI Agent 测试与可观测性平台,帮助团队在上线前发现并修复 Agent 问题,类似 AI Agent 领域的 CI/CD 工具链。

▲ 349 freemium

WorkClaw

78

Collaborative, proactive AI coworkers who work in Slack

WorkClaw 是一款将 AI 协作者嵌入 Slack 和 Teams 的团队级智能助手平台,解决传统 AI 工具只能服务单个用户、无法融入团队协作流程的问题。

▲ 284 freemium

Darkmoon

78

Autonomous penetration testing platform

Darkmoon 是一个自主渗透测试平台,通过 18 个专业 AI 智能体和 80+ 攻击性安全工具,覆盖 AD、Kubernetes、云基础设施等多层面,帮助安全团队自动化完成从测试到报告的完整渗透测试流程。

▲ 88 free

Unreal Engine 5.8

78

Build unreal games with AI agents

Unreal Engine 5.8 是 Epic Games UE5 生命周期的最终里程碑版本,面向游戏开发者提供实验性 3D 网格地形、生产级 MegaLights 以及原生 MCP 插件支持 AI 智能体自动化开发流程。

▲ 142 free

Tine

78

An AI desktop cursor that does the work for you

Tine 是一个运行在 Mac 刘海区的 AI 第二光标,能感知屏幕上下文并直接跨应用操作,无需切换窗口或手动粘贴,实现真正的端到端任务自动化。

▲ 77 unknown

Agentic videos by D-ID

78

Interactive videos that talk back

D-ID 的 Agentic Videos 将普通视频转化为可交互的 AI 体验,观众可在视频中实时提问并获得 AI 驱动的虚拟主播回答,实现个性化内容消费。

▲ 171 freemium

Elvin

78

Proactive AI that finds and finishes work before you ask

Elvin 是一款主动式 AI 工作助手,自动跨工具发现并处理协调类任务,将消息、会议、文档等散落信息转化为可审批的草稿和后续行动,解决用户充当 AI 与实际工作之间「路由层」的低效问题。

▲ 228 freemium

Locus Founder

78

Text an AI agent and it builds + runs your business

Locus Founder 是一个 AI 驱动的全自动创业代理,通过短信交互即可帮用户从零搭建并持续运营一个完整的在线业务,涵盖品牌设计、全栈开发、支付集成、供应链和广告投放。

▲ 90 unknown

Novu Connect

78

Ship agents where your users already work

Novu Connect 是一个面向开发者的 AI Agent 多渠道通信基础设施,让 AI Agent 无需自建集成即可通过 Slack、Teams、WhatsApp、Telegram、邮件等渠道与用户进行双向对话。

▲ 330 freemium

Kimi K2.7 Code

78

Kimi’s most capable coding model yet

Kimi K2.7 Code 是 Moonshot AI 推出的最新编程专用 Agent 模型,支持 256K 超长上下文与多模态输入,主打长链路软件工程任务,推理 token 消耗比上代降低约 30%。

▲ 253 freemium

Asmi AI

78

AI that handles your personal chores in the real world

Asmi 是一个 AI 语音助理,每天早晨主动致电用户了解待办事项,然后代替用户拨打电话处理日常杂务(预约、沟通、等待接听),并通过 iMessage 或 WhatsApp 汇报结果。

▲ 330 freemium

Cignara

78

AI Agents for Fortune 500 grade customer support

Cignara 为企业提供具备严格策略治理的 AI 客服代理,支持语音与文字全渠道对话,主打零幻觉、可验证的客户服务自动化。

▲ 82 paid

Devin Desktop

78

Manage fleets of local and cloud agents from one surface

Devin Desktop 是一款面向开发者的 AI 代理管理桌面工具,允许用户在编辑器内统一管理本地与云端 AI 编码代理,实现任务规划、委派、审查和交付的全流程闭环。

▲ 101 freemium

Brief

78

Navigate your agents to product-market fit

Brief 是一个为产品团队打造的「活体知识库」,将产品决策、战略意图和执行上下文统一管理,并通过 Chat、Slack、CLI 和 MCP 接口向人类成员和 AI 智能体实时提供相关上下文,防止 AI 在开发过程中「失去方向」。

▲ 230 freemium

Vokal

78

A collaboration space for 10x teammates with their Al agents

Vokal 是一个多人 AI 协作空间,让团队成员和各自的 AI 编程代理(如 Codex、Claude Code)在同一个工作区实时协作,解决跨 AI 代理无法直接通信、需要人工中转的效率痛点。

▲ 424 freemium

Rex

74

AI agents that run order-to-cash operations

Rex 为全球企业构建 AI 驱动的订单到现金(Order-to-Cash)自动化工作团队,通过智能 Agent 覆盖每个账户并在资金卡滞前主动处理异常。

▲ 104 paid

Agentcard for companies

74

Give your agent a debit card

为 AI Agent 提供一次性虚拟借记卡,允许开发者从钱包中划拨固定预算,让 Agent 能够自主完成在线支付,解决 AI 自动化流程中的支付授权与预算控制问题。

▲ 172 freemium

Pazi

74

Vibe code business operations

Pazi 是一个 AI 智能体团队平台,帮助个人创业者将想法(书籍、店铺、应用、技能变现)快速落地,自动完成建站、外联、内容创作等业务运营任务。

▲ 576 freemium

AI Agent · KOL 观点

Andrej Karpathy 提出了一套完整的 AI 工程方法论,核心是将上下文窗口视为代码(Software 3.0),用工程化思维(规范设计、差异审查、评估循环)替代随意的 Prompt 尝试。他还推广了并行 Agent 管理模式和 CLAUDE.md 配置文件,构建出一套从世界观到具体工具的完整实践体系。

Anthropic的Claude Code创始人Boris Cherny披露,他已8个月未亲手写过一行代码,完全依靠管理数千个AI Agent完成软件开发工作。截至2026年5月,超过80%合并进Anthropic代码库的代码由Claude自主撰写,代码产出量较年初增长8倍。更值得关注的是,该系统已开始自主浏览GitHub和X寻找下一步构建方向,递归自我改进正在成为现实。

Anthropic 公开了其内部 AI 辅助编程的规模化数据:截至2026年5月,Claude 已负责超过80%的生产代码提交,工程师人均代码产出提升8倍,开放性任务成功率达76%(半年内提升50个百分点)。这是业界首份来自前沿实验室的、基于真实生产环境的 Agentic 编程规模化原始数据报告,而非基准测试或演示。文章提炼了可供工程团队直接参考的工作流模式,如 maker-checker 循环等。

Andrej Karpathy 展示了 AI 自主科研的早期实践:他用约30行代码构建了一个自动化研究智能体 AutoResearch,能够在无人干预的情况下循环执行假设-实验-验证流程,两天内发现约20项互补优化,将训练速度提升11%。这标志着 AI 从执行指令向复现科学方法的跨越,Karpathy 本人也于2026年5月加入 Anthropic 将此方法规模化应用于 Claude 的研究。

Andrej Karpathy 发布了开源项目 autoresearch,一个仅 630 行 Python 代码的自主 AI 研究框架,能在无人干预的情况下一夜完成上百次实验迭代。其核心创新在于让 AI agent 直接修改训练代码而非调参,实现了开放式架构探索。实测结果显示,该系统在 Karpathy 已优化的代码基础上再提速 11%,并发现了人类研究者遗漏的 bug。

Greg Isenberg认为未来10年最大的创业机会是专为AI Agent构建的基础设施和服务层。他列举了19个具体方向,核心逻辑是:Agent在消费、权限、安全、法律、支付等维度的行为模式与人类截然不同,现有工具无法满足,催生出全新的垂直市场。这与移动互联网时代围绕智能手机建立基础设施的历史路径高度相似。

Karpathy警告AI行业,当前Agent热潮存在重蹈OpenAI五年弯路的风险。其核心论点是:Agent能力的天花板取决于底层基础模型的质量,在基础模型尚未成熟时强推Agent只会导致失败。Anthropic和OpenAI在AI4S领域的最新布局,恰好印证了这一判断——两者都在用工作流和生态整合来弥补基础模型的结构性不足。

Greg Isenberg 提出 AI Agent 是新一代 SaaS 浪潮,核心转变是从「卖软件工具」变为「卖已完成的工作」。他给出了一套完整的 7 步落地方法,包括选定细分领域、人工影随、构建最小可用 Agent,以及以劳动力而非软件的方式定价销售。该框架对于想切入 Agent 创业的人具有极高的操作参考价值。

Karpathy提出将笔记视为不可变'源代码'、以LLM为'编译器'构建结构化个人知识库的新范式,用三层架构(原始层/模式层/Wiki层)取代传统RAG的碎片化检索。该框架通过Ingest、Query、Lint三类操作自动维护知识一致性,解决了个人知识管理长期存在的维护成本过高问题,被视为继Vibe Coding和Agentic Engineering之后人机协作的第三个重要范式。

Greg Isenberg 提出「AI Agent 即新 SaaS」的核心论点:软件正从辅助工作转变为直接完成工作,创业者应将某个具体岗位的工作流打包成服务出售,定价逻辑对标劳动力而非软件授权。他给出了一套完整打法:锁定带薪工作流、深度跟岗观察、构建最小可用 Agent、以试点形式销售,再逐步产品化。文章以 Slang AI、Same Day 为真实案例,并附 30 天从零启动计划。

Claude Code凭借软件领域独有的可验证奖励机制(编译器+测试套件)实现了强化学习的突破,成为史上最快达到十亿美元年化营收的软件产品。文章核心论点是:代码之所以率先被AI攻克,不是因为编程简单,而是因为它是极少数拥有客观评分函数的知识工作领域。这一结构性优势正在向其他行业蔓延,关键在于谁能为下一个领域构建'答案钥匙'。

本文系统介绍了 Andrej Karpathy 提出的 LLM Agent 记忆四分类框架:权重内记忆、上下文记忆、外部检索记忆和 KV 缓存记忆,并结合 Python 代码讲解每种记忆的实现方式。文章兼具理论深度与工程实用性,是构建 AI Agent 记忆系统的高质量参考指南。

AI购物代理(如ChatGPT、Perplexity)正在真实下单,Adobe数据显示AI来源流量在2026年Q1同比增长393%,转化率比自然流量高42%。文章提供了一份六大支柱自评清单(产品数据流、结构化数据、协议集成、机器可读政策、信任信号、AI引用),帮助商家诊断自身对AI代理的可见性与可交易性。当前仅3%的交易通过AI代理完成,但72%的商家承认消费者接受速度将超过自身准备速度,窗口期正在关闭。

Anthropic Claude Code负责人Boris Cherny在Meta @Scale大会上提出,AI编码正进入第三阶段:由Agent互相调用Agent来完成代码编写,形成持续运行的递归循环结构。这种'loop'模式颠覆了传统的'启动-检查-停止'工作流,子Agent会持续在后台监控代码库、提交PR,直到收到终止信号,Cherny本人已在日常开发中运行此类持久化子Agent。

Claude Code 的创始人 Boris Cherny 在一个月内提交了 259 个 PR、却未手写一行代码后,彻底卸载了 IDE,转向「循环工程」(Loop Engineering)范式——即构建能自动发现任务、调度执行、判断完成并决定下一步的小型系统。文章详细拆解了循环的三层「蜂巢」架构(本地循环层、云端例程层、集群并行层)和六大核心组件,并指出这一范式并非全新技术,而是 ReAct、AutoGPT 等已有思路的系统化落地。

Claude Code创始人Boris Cherny已完全转向自动化Agent工作流,不再手动编写提示词或使用IDE。他通过三层架构(/loop、Routines、动态工作流)实现白天5-10个交互式Agent、夜间数千个并行Agent的规模化运作,核心是让Claude自主编排任务、执行并自我验证结果。文章提供了完整的可复用模板,包括斜杠命令文件、cron表达式和800-Agent并行工作流代码。

Anthropic的Claude Code负责人Boris Cherny表示,自年初以来Anthropic的代码产出提升了8倍,且他本人已8个月未手写过一行代码。代码审查已成为新瓶颈,Anthropic通过多个具备不同视角的Claude agent协作进行代码审查来应对。更值得关注的是,Claude Code正逐步具备自主提出功能想法的能力,能主动扫描GitHub、Twitter、Slack后生成经过验证的PR。

Greg Isenberg 与联合创始人 Theo Taba 系统讲解了如何构建 AI 原生组织,核心是让人管理自主 Agent、Agent 读写公司知识库,并通过「技能链」替代单一提示词来大幅提升输出质量。现场演示了 5 分钟内生成客户提案微站、10 分钟内搭建功能原型,证明该方法论具备直接落地价值。

Karpathy通过'幽灵'隐喻解释了LLM的本质局限:它们不是从世界中成长的动物,而是从文本库中召唤出的统计幽灵,缺乏真实的情境世界模型。文章以此为基础,构建了Spec、Verifier、Environment三层Agentic AI框架,试图弥补这一根本性缺陷。核心洞察是:LLM的幻觉、锯齿状智能、失忆和易受骗性,都源于它对情境的根本性缺失。

Claude Code 的创造者 Boris Cherny 认为,随着 AI 编程能力的成熟,'软件工程师'这一职位将逐渐消失,取而代之的是'构建者'(Builder)——一种以 AI 为中心、以判断力和目标感驱动的工作角色。黑客马拉松的结果表明,非技术背景的人(电工、医生、木匠)借助 AI 代理反而胜过专业工程师,说明真正稀缺的能力是'知道自己要构建什么'。他以1990年代企业采用个人电脑的历史为鉴,强调只有将 AI 置于工作流核心的组织才能获得真正的生产力提升。

Salesforce 使用 Claude Code Agents 将原本需要 231 天的代码迁移任务压缩至 13 天完成,同期 PR 数量上升但系统故障率反降 5%。这打破了'效率与质量不可兼得'的传统认知,核心在于将安全护栏和质量标准直接内嵌于 Agent 工作流中。作者强调,AI 真正的价值不在于加速现有流程,而在于重构工作方式、消除不必要的环节和交接。

Claude Code创始人Boris Cherny分享了AI编程工具如何重塑软件工程的核心洞察:工程师角色已从写代码转向编排AI工作流,Anthropic内部人均生产力提升200%,新工程师上手时间从数周缩短至两天。他预言通才工程师的黄金时代已到来,甚至对'品味'这一被认为是人类持久优势的东西提出了质疑。

Andrej Karpathy 在 Sequoia AI Ascent 2026 上提出「Agentic Engineering」概念,认为这是继 Vibe Coding 之后更具工程纪律的 AI 编程范式。他将 2025 年 12 月定义为 AI 编程能力的关键拐点,并以 Software 3.0(prompt 即编程)框架描述大模型作为解释器、上下文窗口作为核心杠杆的新开发方式。

Karpathy 在 Sequoia Ascent 2026 上提出 Software 3.0 框架:LLM 是解释器,上下文窗口就是程序本身,提示词/工具/记忆取代了传统代码。这不是现有开发流程的加速,而是一种范式跃迁——许多原本需要完整应用架构才能解决的问题,现在一个提示词即可完成。对 AI 创业者的核心追问是:哪些软件根本不应该继续以软件形态存在?

Karpathy 在 Sequoia Ascent 演讲中提出 Software 3.0 的概念框架,将 LLM 定义为继显式代码(1.0)和训练权重(2.0)之后的第三个可编程层,核心组成为提示词、智能体、工具、记忆与验证。他将 2025 年 12 月标记为 AI 智能体从演示走向实际生产的拐点。其核心判断是:下一代 AI 原生公司的竞争壁垒不在于 UI 封装,而在于谁拥有最强的验证闭环。

Andrej Karpathy 于2026年3月发布了一个约30行代码的AI自动化研究原型,让智能体自主编辑训练代码、运行实验并迭代优化,两天内完成700次实验,将GPT-2训练时间缩短11%。随后他加入Anthropic,将这一循环引入Claude的预训练流程,目标是用AI替代人工ML研究者加速训练优化的发现过程。

探索其他赛道