← 返回首页
AI Agent

AI Agent

自主智能体、多 Agent 协作、Agentic Workflow 与 Computer Use

1415 个产品 578 条观点

AI Agent · 精选产品

GPT-6 Astra

94

OpenAI's most capable model for end-to-end work

GPT-6 Astra 是 OpenAI 迄今最强大的 AI 模型,面向复杂推理、软件工程、科学研究及专业工作场景,支持异步工具调用与多步骤智能体工作流。

▲ 173 paid

GPT-5.6

88

A new standard for intelligence and efficiency

OpenAI 发布 GPT-5.6 模型家族,提供旗舰版(Sol)、均衡版(Terra)和轻量版(Luna)三档选择,面向开发者推出程序化工具调用、多智能体并行执行及显式提示缓存等新能力。

▲ 274 paid

Google Gemini 3.8 Flash and Cyber

85

Next-gen Gemini for agents, reasoning, and cyber security

Google 推出新一代 Gemini 3.8 Flash 模型,专为 AI 智能体工作流与网络安全场景优化,支持长链推理、自主任务执行与漏洞检测,以低成本高速度提供企业级 AI 能力。

▲ 137 freemium

Typewise Nova

84

AI customer experience that builds and improves itself

Nova 是一个无需开发者的 AI 客服运营平台,能用自然语言描述自动构建、测试并持续自我优化 AI 客服代理团队,覆盖邮件、聊天和 WhatsApp 全渠道,按成功解决请求收费。

▲ 169 freemium

Hy4 preview

84

Tencent’s 770B open model for long-horizon work

腾讯开源的770B MoE大模型,专为长程自主代理任务设计,能自主完成编程、游戏开发及复杂文档分析,并自动运行测试与修复Bug。

▲ 117 free

Spline V2

84

Best 3D platform for the agentic era

Spline V2 是一款面向 AI 时代的全新重构 3D 编辑器,集成 AI Agent 模式与 MCP 协议、WebGPU 渲染引擎及 PBR/HDR 工作流,让设计师和开发者能更高效地创作交互式 3D 内容。

▲ 83 freemium

Caddi

84

Agent that builds agents by only showing your work only once

Caddi 通过录制一次操作演示,自动将用户的后台工作流程转化为可在真实工具中持续运行的 AI 自动化智能体,无需开发者或复杂配置。

▲ 123 freemium

Ojin

83

Talk to an AI Agent with a real face and voice, in real time

Ojin 提供带有真实面孔和声音的 AI 智能体 API,支持实时打断式自然对话,只需一张照片即可创建可交互的数字人形象。

▲ 78 freemium

Agentic Video Understanding in Gemini

82

Agentic video analysis for faster, smarter Gemini insights

Google Gemini 推出智能体视频理解模式,让模型自主决定观看策略,大幅降低 token 消耗和成本,同时提升长视频分析准确率。

▲ 137 paid

Gemini 3.8 Flash

82

Most intelligent workhorse yet for coding and agents

Google 推出的最新 Flash 系列 AI 模型 Gemini 3.8 Flash,专为编程、智能体任务和多步推理设计,以极具竞争力的价格提供高性能的代码生成与自主任务执行能力。

▲ 113 paid

Gemini 3.7 Flash

82

Google's smartest workhorse yet for coding & agents

Google 推出 Gemini 3.7 Flash,专为编程和 AI 智能体任务优化的高性能轻量级大语言模型。

▲ 206 freemium

Human Behavior

82

Product analytics told you what happened. We handle it.

Human Behavior 是一款 AI 驱动的产品分析工具,不仅捕获用户行为和会话回放,还通过后台 AI 智能体自动分析问题、触发修复动作(如发邮件、更新 CRM、提 PR),实现产品改进的闭环自动化,无需人工盯仪表盘。

▲ 225 freemium

Prime Agent

82

A coding agent that can refine its own harness

Prime Agent 是一个开源的自改进编程智能体,通过递归语言模型(RLM)和持续迭代框架(Continual Harness)两大核心抽象,让 AI 编程助手能够自我优化其执行环境,在 ARC-AGI-3 基准上达到 95.5% 的顶尖水平。

▲ 158 free

Coldtea.ai

82

Make your software delivery self-driving

Coldtea 是一款面向开发团队的 Agentic IDE,通过 AI 编码代理、视觉 QA 代理和 AI 生产监控的协同工作,解决团队在 AI 加速交付背景下频繁引入生产故障的问题。

▲ 406 freemium

Muse Code

82

Meta’s terminal agent for long-horizon coding

Muse Code 是 Meta 推出的终端编程智能体,基于 Muse Spark 1.2 模型,支持长周期任务、仓库级代码执行与内置验证,旨在解决开发者处理复杂、跨文件、长时间编码任务的效率问题。

▲ 206 unknown

Cloudflare Wallets

82

the programmable wallet for the agentic Internet

Cloudflare Wallets 为 AI 智能体提供可编程钱包层,使其能够自主发现、使用并支付 API 和数字服务,构建下一代 AI 应用的金融基础设施。

▲ 250 freemium

DeepSeek-V4-Flash-0731

82

Frontier agent intelligence at Flash prices

DeepSeek-V4-Flash-0731 是 DeepSeek 官方发布的高性能轻量级大语言模型,以低价格提供媲美旗舰模型的 Agent 推理能力,并原生支持 Responses API 与 Codex CLI。

▲ 253 freemium

Conduit

82

AI agents purpose-built for Hospitality

Conduit 是专为酒店行业打造的 AI 智能体平台,自动处理跨渠道宾客对话并联动后端系统,实现从沟通到运营的全流程自动化。

▲ 114 paid

Claude Opus 5

82

Near-Fable 5 intelligence at half the price

Claude Opus 5 是 Anthropic 推出的新一代旗舰大语言模型,以一半的价格提供接近顶级的智能水平,专为长时运行的 AI Agent、编程和专业工作场景优化。

▲ 332 paid

CartAI

82

The AI agent that handles checkout.

CartAI 是一个面向开发者的 AI 结账代理 API,能在任意电商平台自动完成购物结账全流程,无需商家侧集成,同时内置支付、商品搜索和佣金变现能力。

▲ 367 paid

Clark

82

An AI coworker with its own cloud computer

Clark 是一个拥有独立云端计算机(浏览器、终端、文件、代码环境)的 AI 协作员,用户可以将复杂任务完整交给它异步完成,涵盖研究、代码、文档等多种交付物。

▲ 441 freemium

Verse

82

Build and hire autonomous AI employees from a single prompt

Verse 让用户通过一句提示词即可创建并「雇用」具备完整数字身份和工具能力的自主 AI 员工,代替人类 24/7 独立完成工作任务。

▲ 105 freemium

ChatGPT Work

82

Partner for your most ambitious work

ChatGPT Work 是 OpenAI 面向职场场景推出的 AI 智能体产品,能够跨应用和文件持续执行复杂任务,将用户目标转化为完整的工作成果。

▲ 190 freemium

Coasty

82

A Computer-Use-Agent that runs legacy software like a human

Coasty 是一个计算机操控 AI 代理,能像人类一样自主操作桌面软件(无需 API),主要解决医疗、保险、税务等行业中遗留系统自动化难题。

▲ 131 paid

Context.dev

82

One API to scrape, enrich, and extract the internet

Context.dev 是一个面向 AI 产品和 Agent 的 Web 上下文 API,通过单一接口提供网页抓取、结构化数据提取、Markdown 转换、截图及公司品牌信息等能力,帮助开发者快速为 AI 应用注入互联网数据。

▲ 251 freemium

Sequence Agentic

82

Money movement for AI agents

Sequence 是面向 AI Agent 的金融执行层,允许 AI 代理通过 API 真实地发送、拆分和路由资金,同时通过权限隔离、服务端限额和审计日志确保安全可控。

▲ 202 freemium

Claude Sonnet 5

82

AI that plans, acts, and gets work done

Anthropic 推出的最新 Claude Sonnet 5 模型,专注于 Agentic AI 能力,能够自主规划、执行任务,适用于编程和日常专业工作场景。

▲ 304 freemium

Tabstack Browser Automation

82

Automate the web in your app or agent, no browser to host

Tabstack 是 Mozilla 推出的浏览器自动化 API,开发者只需一句自然语言即可驱动真实浏览器完成网页操作,无需自行托管浏览器或配置框架。

▲ 314 unknown

Cursor for iOS

82

Build with coding agents from anywhere

Cursor 推出 iOS 原生应用,让开发者可以随时随地通过手机启动云端 AI 编程 Agent、监控任务进度并合并 PR,打破本地机器的时空限制。

▲ 467 freemium

Framer 3.0

82

With Agents, Branching, Community, and an all-new design

Framer 3.0 是一款面向设计师和团队的 AI 驱动网站构建工具,通过引入 AI Agents、分支协作和社区变现机制,让团队能更高效地设计、迭代和发布网站。

▲ 419 freemium

Claude Opus 4.8

82

Reasoning model with 1M context for agentic work

Claude Opus 4.8 是 Anthropic 推出的推理型大语言模型,拥有 100 万 token 超长上下文窗口,专为开发者和企业团队处理复杂代码、长周期智能体任务和多日工作流而设计。

▲ 5 paid

NVIDIA Nemotron 3 Ultra

82

The first open frontier model built for agents

NVIDIA 发布的 550B 混合专家开源大模型,专为多步骤 AI Agent 任务优化,以开源经济成本实现前沿推理能力。

▲ 6 freemium

Nemotron 3 Ultra by NVIDIA

82

Powers faster, efficient reasoning for long-running agents

NVIDIA 发布的 550B 参数混合专家开源大模型,专为长时间运行的 AI Agent 优化,相比同类开源前沿模型推理速度提升 5 倍、成本降低 30%。

▲ 153 free

Spectron

82

Agent memory you can trust

Spectron 是一个为 AI Agent 设计的统一记忆基础设施,将图数据库、向量、文档和结构化数据整合在单一 ACID 事务基底上,解决多存储拼接、数据溯源困难和记忆不可信的问题。

▲ 157 unknown

Fundraisly

82

AI fundraising agent that finds investors and books meetings

Fundraisly 是一款 AI 融资代理工具,帮助创业者从 30 万+投资人数据库中精准匹配活跃投资人、挖掘人脉路径并自动发起冷邮件触达,目标是为每位创始人预约 20-40 场合格投资人会议。

▲ 918 paid

Viso Now

81

Build computer vision applications with AI

Viso Now 是一个自构建 AI 视觉平台,用户只需用自然语言描述需求,即可将图像、视频和摄像头流转化为可运行的计算机视觉应用,无需模型训练、数据标注或编写代码。

▲ 84 freemium

AI Observability by OpenObserve

81

OpenTelemetry-native observability for agents and LLMs

OpenObserve 为 AI Agent 和 LLM 提供 OpenTelemetry 原生的全链路可观测性平台,帮助开发者精确追踪每次 Agent 会话的时间消耗、API 成本与质量问题。

▲ 167 freemium

Harden

81

A security layer for AI coding agents

Harden AIF 是一款面向 AI 编程代理的本地安全防护工具,通过在工具调用执行前进行上下文感知的安全检测,防止恶意或危险操作,且全程数据不离本机。

▲ 161 free

Catenary

81

Spatial canvas IDE for AI coding agents

Catenary 是一个空间画布式本地 AI 编程 IDE,允许开发者通过可视化“电缆”连接和编排多个 AI 代理协同工作,解决多 AI 代理上下文混乱和终端标签页泛滥的问题。

▲ 78 free

Hyperprobe

81

Lets your AI agents debug production without redeploying

HyperProbe 让 AI 编程助手(如 Claude Code、Codex、Cursor)能够在不重新部署的情况下,向生产环境中的运行服务注入只读探针,捕获未被记录的变量状态,从而帮助后端团队一次性闭环难以本地复现的线上 Bug。

▲ 125 freemium

Nex

81

Claude Cowork for high-volume GTM workflows

Nex 是一款专为高频 GTM(市场进入)工作流设计的 AI 自动化平台,由前 HubSpot 核心团队打造,基于 Claude AI,填补通用 AI 代理在复杂销售营销场景中的能力空白。

▲ 101 unknown

Agent Builder by Airtop

81

Build agents that heal themselves.

Airtop Agent Builder 是一款 AI 自愈代理构建平台,用户用自然语言描述工作流,系统自动编译为可执行自动化代码,并在运行失败时自动诊断、修复并验证,无需人工干预。

▲ 160 freemium

Devin Voice

80

You say it, Devin ships it

Devin Voice 是 Cognition AI 为其 AI 软件工程师 Devin 推出的语音交互界面,用户只需开口说出需求,Devin 即可自动规划、编码并交付软件成果。

▲ 96 freemium

screenpipe

80

AI that records your computer work to power agents.

screenpipe 是一款本地优先的全屏录制与活动追踪工具,通过 MCP 协议将用户的电脑工作历史开放给 AI 代理,让用户无需手动重建工作上下文即可快速检索通话、文档和代码信息。

▲ 68 freemium

Cline Desktop App

79

An open-source app for open-weight models

Cline Desktop 是一款开源 AI 编程助手桌面应用,允许开发者自由选择模型与服务商,支持多 Agent 并发、任务自动化及插件市场,打破闭源生态束缚。

▲ 135 freemium

Noodle Seed

79

Your product in AI and AI in your product

Noodle Seed 为软件团队提供 AI Agent 就绪的托管运行时,帮助开发者将产品工作流暴露给 AI Agent,并统一管理身份、权限、密钥和审计,无需手动拼接 MCP SDK 和基础设施。

▲ 135 freemium

Mastra Factory

78

From issue to production, run by agents.

Mastra Factory 是一个开源的 AI Agent 驱动软件交付环境,将从 Issue 提出到代码合并的完整开发流程自动化,让 AI Agent 负责规划、编码与 PR 审查。

▲ 224 freemium

Switch

78

Bring any AI agent into Slack, Teams & Discord. Open-source.

Switch 是一款开源工具,让 AI 智能体以命名参与者身份加入 Slack、Teams、Discord 等协作平台,共享团队上下文并跨项目复用,打通 AI 与团队协作工具的壁垒。

▲ 243 freemium

Reflexio

78

Behavioral learning that makes AI agents better over time

Reflexio 是一个 AI 智能体行为学习平台,通过记录用户纠错、路径失败和成功经验,让 AI 智能体在每次交互后持续自我优化,实现降低失败率 30% 以上并节省 60% 以上 Token 消耗。

▲ 165 freemium

Doop

78

Design with AI agents - live on the same canvas

Doop 是一个无限多人协作画布,允许 Claude、Codex 等 AI 智能体与用户实时共同设计,共享上下文记忆,用户自带 AI 订阅无需额外付费,完全开源。

▲ 85 free

Dial

78

Give your AI agent a real phone number in 10 seconds

Dial 为 AI 智能体提供真实电话号码,支持通过一次 API 调用在 10 秒内完成部署,实现语音通话、短信收发及 iMessage 消息,解决 AI 代理无法通过电话验证的痛点。

▲ 109 freemium

Monid

78

OpenRouter for agent tools

Monid 是一个 AI Agent 工具聚合平台,用一个 API Key 连接 1800+ 第三方 API,无需单独订阅,覆盖 SEO、线索生成、视频/音乐生成、社交媒体、股票、链上数据等场景。

▲ 163 freemium

GitNexus (Akon Labs)

78

The open-source kernel for coding agents

GitNexus 是一个开源的代码知识图谱内核,将企业所有代码库统一为结构化图谱,让 AI 编程智能体能精准查询代码依赖关系,降低 51% 的运行成本。

▲ 97 freemium

Traccia

78

Finally, a vendor-neutral AI Agent Control Plane.

Traccia 是一个厂商中立的 AI Agent 控制平面,帮助团队在生产环境中观测、评估、治理和审计自主 Agent 的行为,解决多模型/多框架下 AI Agent 的可控性与可观测性问题。

▲ 118 freemium

OpenComputer

78

Firebase for Agents

OpenComputer 为 AI Agent 提供按需隔离的 Linux 云计算环境,解决 Agent 运行时需要真实操作系统、持久化状态和安全密钥管理的基础设施问题。

▲ 101 freemium

PostHog Desktop

78

The product editor for product builders

PostHog Desktop 是一个面向产品开发团队的多人协作工作区,将产品数据、AI 智能体与代码编辑能力整合,帮助团队基于真实用户数据快速构建、迭代和度量产品。

▲ 147 freemium

Purchase API by Agentcard

78

one API call and your agent buys anything online

Agentcard 提供一个 API,让 AI 智能体只需一次调用即可自动完成在线购物全流程(搜索商品、结账、支付),解决 AI Agent 无法自主完成电商交易的问题。

▲ 81 freemium

Agnost AI

78

Catch agent failures your evals miss

Agnost AI 通过分析生产环境中 AI 智能体的对话,自动发现静默失败、幻觉、用户流失信号等问题,并将其转化为可执行的评估指标和修复方案。

▲ 120 freemium

akta.pro

78

Private company data and signals API for the agent economy

akta.pro 是一个私有公司数据与信号 API,为金融服务和 GTM 团队提供比 PitchBook 更深度、更广覆盖的企业数据及 100+ 事件信号,支持交易尽调和精准外呼触达。

▲ 175 paid

Zero

78

Vercel's programming language built for AI agents

Zero 是 Vercel 推出的实验性编程语言,专为 AI 智能体编写代码而设计,通过语义程序图替代传统源文本编辑,让 AI 代理高效查询和修改代码,人类只需描述目标并审阅可读的代码投影。

▲ 80 unknown

AI Agent · KOL 观点

Karpathy提出LLM不应被视为聊天机器人,而应被理解为新型操作系统的内核进程,能够协调多模态输入输出、代码执行、浏览器访问和记忆存储等功能。他将当前主流LLM(GPT、PaLM、Claude、Llama)类比为Windows/macOS/Linux,认为我们正处于一个全新计算范式的早期阶段。将LLM看作聊天机器人,就如同将早期计算机仅视为计算器一样短视。

Karpathy 认为 AI 训练范式正经历第三次转型:从预训练(互联网文本)到监督微调(对话数据),再到如今的强化学习时代(环境交互)。他看好「环境」作为核心训练资产的未来,但对 RL 本身持保留态度,认为奖励函数存在根本性缺陷,人类学习方式远比 RL 高效,真正的突破尚未到来。

Andrej Karpathy 提出了一套完整的 AI 工程方法论,核心是将上下文窗口视为代码(Software 3.0),用工程化思维(规范设计、差异审查、评估循环)替代随意的 Prompt 尝试。他还推广了并行 Agent 管理模式和 CLAUDE.md 配置文件,构建出一套从世界观到具体工具的完整实践体系。

Anthropic的Claude Code创始人Boris Cherny披露,他已8个月未亲手写过一行代码,完全依靠管理数千个AI Agent完成软件开发工作。截至2026年5月,超过80%合并进Anthropic代码库的代码由Claude自主撰写,代码产出量较年初增长8倍。更值得关注的是,该系统已开始自主浏览GitHub和X寻找下一步构建方向,递归自我改进正在成为现实。

安全研究员 Boris Cherny 通过构造多步骤攻击链,成功以 60-80% 的成功率突破了 Claude Code Opus 5 的 Auto Mode 安全防护,实现了代码执行。这与 Anthropic 委托第三方(Trajectory Labs)评估得出的 0.00% 攻击成功率形成直接矛盾。攻击核心在于利用 Python 模块路径劫持(struct.py 影子模块),绕过模型对直接二进制执行的拒绝。

Anthropic 公开了其内部 AI 辅助编程的规模化数据:截至2026年5月,Claude 已负责超过80%的生产代码提交,工程师人均代码产出提升8倍,开放性任务成功率达76%(半年内提升50个百分点)。这是业界首份来自前沿实验室的、基于真实生产环境的 Agentic 编程规模化原始数据报告,而非基准测试或演示。文章提炼了可供工程团队直接参考的工作流模式,如 maker-checker 循环等。

Karpathy 指出随着 token 需求的爆发式增长,LLM 底层芯片的内存与计算编排将成为最具价值的技术挑战。核心矛盾在于片上 SRAM(快但容量小)与片外 DRAM(容量大但带宽受限)两种内存池的物理约束,如何在推理/训练等工作负载中实现最优吞吐/延迟/成本比是当前最重要的工程智识难题。他顺势为 MatX 团队的新芯片融资背书,认为其方向切中了现有 NVIDIA(HBM优先)和 Cerebras(SRAM优先)两大阵营均难以同时满足的长上下文 agentic 推理场景。

Andrej Karpathy 与 Sarah Guo 深度对话,探讨 AI 代理(Code Agents)的现状与未来,重点介绍其 AutoResearch 项目——让 AI 代理自主完成实验设计、数据收集和模型优化的闭环研究流程。同时讨论了自然语言编程的二阶效应、AI 时代的相关技能、模型分化(Model Speciation)以及 AI 对就业市场的影响。

Karpathy 描述了编程范式从「氛围编程」(vibe coding)向「代理工程」(agentic engineering)的演进,提出了 Software 3.0 的概念——通过提示词和上下文而非显式代码来编程。他强调 LLM 如同易错的「幽灵」,需要新型判断力,并指出思考可以外包但理解力永远不能外包。

安全研究员 Johann Rehberger 证明了 Claude Code Auto Mode 存在通过 Python 模块劫持实现远程代码执行的漏洞,成功率高达 60-80%,而 Anthropic 委托的第三方评估却声称该模式零提示注入攻击成功率。Anthropic 将此漏洞披露归类为「按设计运行」,拒绝修复,导致其安全营销宣传与实际漏洞现实之间出现公开矛盾。文章深刻揭示了基准测试覆盖范围与真实攻击面之间的本质差距,以及 AI 分类器「批准命令」与「命令执行结果安全」之间的语义错位。

Claude Code创始人Boris Cherny建议用户每6个月清空一次AI指令文件(如CLAUDE.md),因为底层模型持续升级后旧指令可能反而成为限制。他强调验证机制比提示词工程更重要,并指出Opus 5已大幅增强对提示注入的抵御能力,智能体可连续工作数天甚至数月。Anthropic内部每天运行20-30个Claude例行任务用于代码维护,标志着AI工作流进入新阶段。

Greg Isenberg 列举了23种利用AI Agent驱动初创公司增长至100万ARR的具体策略,涵盖客户留存、竞争情报、内容营销和销售自动化等场景。这些策略的核心思路是将AI Agent接入现有工具链(Stripe、PostHog、Apollo等),在关键时机自动触发精准动作。整体偏向实操性强的增长黑客方法论。

Riley Brown 展示了如何以 Codex 为操作系统运营 150 万粉丝的单人内容创业,核心方法论是将每个重复性工作流封装为可复用的 Skill,形成难以复制的个人护城河。文章从工程架构层面拆解了 Codex 与 ChatGPT 的本质差异(本地存储 + computer use),并通过 Remotion、SerpAPI 等具体工具链演示了 Skill 驱动的内容生产流程。

Anthropic工程师Boris Cherny(Claude之父)分享了一项实验:让Claude自主维护其应用程序,在数周内提交了388个完全由AI编写的PR,其中180个已被合并。工程师唯一的工作是点击按钮决定是否合并代码。该实验覆盖iOS、Android、桌面、Web、CLI和Agent SDK六个环境,Claude每日自动执行崩溃检测、重复代码合并、死代码清理等任务。

Andrej Karpathy在2025年2月创造了'vibe coding'概念,描述低审查的AI辅助编程方式。到2025年12月,他80%的代码已由AI生成,并于2026年4月宣布vibe coding已过时,取而代之的是他称为'agentic engineering'的更严格工程纪律。这一18个月的思维演变代表了专业软件开发的未来走向。

Anthropic工程师Boris Cherny分享了一个实验:让Claude自动承担应用日常维护工作,包括崩溃检测修复、重复代码统一、死代码清理等,数周内提交388个PR,180个被合并。这一工作流展示了AI Agent在软件工程自动化维护领域的实际落地潜力。

Greg Isenberg 解读 Cloudflare 的 AI Agent 基础设施公告,提出互联网正从「人类浏览页面」转向「Agent 消费资源」的新范式,并基于此提出三个创业方向:垂直数据精炼厂、企业 Agent 就绪度评估、专家知识库转化为 Agent 工具。核心论断是:谁先占据 Agent 访问数据的入口,谁就掌控新互联网的门户。

Andrej Karpathy 探讨了 AI 代码智能体的现状与未来,重点介绍了其 AutoResearch 项目——一个能够自主完成 AI 研究闭环(实验设计、数据收集、训练优化)的智能体系统。他还深入分析了自然语言编程的二阶效应、AI 时代的相关技能演变、模型物种化趋势以及对就业市场的影响。

Anthropic工程师Boris Cherny分享了Claude Code的核心方法论:随着模型能力提升,应主动删除而非增加系统提示词。Opus 5已能用单条指令完成10万行代码重写等复杂任务,并行代理架构使大规模自动化成为现实。提示词注入等安全问题也通过多层防御机制得到基本解决。

Claude Code创始人Boris Cherny分享了其利用AI代理每天合并10-30个PR的工作流程,涵盖自动模式、上下文极简主义、CLAUDE.md配置、验证循环和并行代理等核心实践。核心论点是软件工程师的角色正从「写代码」转向「审查和指挥AI代理」。这代表了一次范式级别的职业转型信号。

Claude Code 创始人 Boris Cherny 在 YC 访谈中提出,AI 产品团队应通过逐行删除系统提示做消融实验来优化 prompt,同时关注「产品过剩」(Product Overhang)和「解缚」(Unhobbling)两个核心概念。他指出,模型的潜在能力往往超出现有产品边界,关键在于通过工具、上下文和自我验证机制将其释放,而非依赖纯 prompt 工程。

2026年AI领域经历了剧烈的情绪转变:从2025年底的普遍悲观(AGI时间线拉长、AI Agent被认为不可用)到Claude Opus 4.5发布后的全面看多。Karpathy等顶级工程师公开表示感到被AI'甩在身后',编程职业正被重构。文章试图梳理这一快速反转背后的7条关键证据线,并审视哪些是真实信号、哪些可能只是新一轮炒作周期。

Karpathy 在 Sequoia AI Ascent 2026 上明确区分了'氛围编程'(vibe coding)与'代理工程'(agentic engineering),认为掌握规格设计、差异审查、评估循环和安全监督的专业开发者可以实现远超10倍的生产力提升。他将2025年12月视为关键拐点,届时 AI 代理生成的代码块变得更大、更连贯、更可靠,开发工作的本质随之改变。这一框架为专业软件工程师在 AI 时代的核心价值提供了清晰定位。

Claude Code 创始人 Boris Cherny 在 YC Startup School 2026 分享了 Claude Code 的构建历程,重点讲述了如何通过删除 80% 的系统提示来提升模型能力,以及随着底层模型持续升级,AI 产品该如何随之重构。他还探讨了 Prompt 工程的演变、大规模运行 AI Agent 的实践,以及编程能力即将被 AI「基本解决」的判断。

Claude Code创始人Boris Cherny介绍了Opus 5的核心突破:模型可自主运行数天乃至数周而无需额外脚手架,且首次在实践中解决了长期困扰AI产品设计的提示注入(Prompt Injection)问题。他还探讨了在底层模型能力持续加速迭代的背景下,如何重构AI产品的系统提示与产品设计思路。

探索其他赛道