Andrej Karpathy总结了2025年AI领域六大范式转变,包括基于可验证奖励的强化学习(RLVR)、Vibe Coding等核心技术突破。RLVR通过在可自动验证奖励的环境中训练LLM,使模型自发形成类人推理策略,成为2025年最重要的训练技术革新。这些转变从根本上改变了大语言模型的训练范式和能力边界。
AI 数据分析
AI 数据分析、BI、可视化、数据挖掘
AI 数据分析 · 精选产品
AlphaGenome Atlas
88Google's AI map of every possible human DNA mutation
Google DeepMind 推出的 AI 基因组图谱,预计算了全部 90 亿种人类 DNA 单碱基突变的影响,帮助研究人员快速探索和优先筛选基因变异位点。
Microduck
84A tiny open-source biped you can train yourself
Microduck 是由 Hugging Face 与 Pollen Robotics 联合推出的 25cm 开源双足机器人,售价 $399,专为强化学习仿真到现实迁移(sim-to-real)研究设计,自带 7 种预训练行为和完全开放的软件栈。
Agentic Video Understanding in Gemini
82Agentic video analysis for faster, smarter Gemini insights
Google Gemini 推出智能体视频理解模式,让模型自主决定观看策略,大幅降低 token 消耗和成本,同时提升长视频分析准确率。
Human Behavior
82Product analytics told you what happened. We handle it.
Human Behavior 是一款 AI 驱动的产品分析工具,不仅捕获用户行为和会话回放,还通过后台 AI 智能体自动分析问题、触发修复动作(如发邮件、更新 CRM、提 PR),实现产品改进的闭环自动化,无需人工盯仪表盘。
reverser.space
82AI Native Collaborative Reverse Engineering Platform
reverser.space 是一个基于浏览器的 AI 原生协作逆向工程平台,允许用户上传二进制文件并与他人或 AI 智能体实时协作分析,无需安装任何工具。
ChatGPT Work
82Partner for your most ambitious work
ChatGPT Work 是 OpenAI 面向职场场景推出的 AI 智能体产品,能够跨应用和文件持续执行复杂任务,将用户目标转化为完整的工作成果。
Mira
82AI moderated interviews that read how people feel
Mira 是一款 AI 全流程用户研究平台,通过面部编码、声音情感分析和眼动追踪,在自动化访谈的同时捕捉受访者的情绪与行为,帮助企业获得更深层的消费者洞察。
Context.dev
82One API to scrape, enrich, and extract the internet
Context.dev 是一个面向 AI 产品和 Agent 的 Web 上下文 API,通过单一接口提供网页抓取、结构化数据提取、Markdown 转换、截图及公司品牌信息等能力,帮助开发者快速为 AI 应用注入互联网数据。
Leni
82The world’s most accurate AI for investors
Leni 是一款专为投资专业人士打造的高精度 AI 分析工具,基于 2.1 万条决策追踪和每日亿级数据处理,提供可审计、可溯源的金融级投资分析与估值输出。
Spectron
82Agent memory you can trust
Spectron 是一个为 AI Agent 设计的统一记忆基础设施,将图数据库、向量、文档和结构化数据整合在单一 ACID 事务基底上,解决多存储拼接、数据溯源困难和记忆不可信的问题。
Viso Now
81Build computer vision applications with AI
Viso Now 是一个自构建 AI 视觉平台,用户只需用自然语言描述需求,即可将图像、视频和摄像头流转化为可运行的计算机视觉应用,无需模型训练、数据标注或编写代码。
AI Observability by OpenObserve
81OpenTelemetry-native observability for agents and LLMs
OpenObserve 为 AI Agent 和 LLM 提供 OpenTelemetry 原生的全链路可观测性平台,帮助开发者精确追踪每次 Agent 会话的时间消耗、API 成本与质量问题。
Compliance by TwelveLabs
79Video compliance review powered by rules you control
基于AI的视频合规审查SaaS,允许团队自定义合规规则包,自动扫描视频库并生成带上下文解释的审查结论,而非简单的时间戳标注。
Tables.so
78AI that finds, qualifies and enriches your next customer
Tables.so 是一款 AI 驱动的销售线索发现与资质筛选工具,用户用自然语言描述目标客户,系统自动从3亿+联系人库中匹配、评分并补充关键信息,大幅缩短销售前期调研时间。
Cohere Parse 5
78Turn complex docs, tables & images into AI-ready data
Cohere Parse 5 是 Cohere 推出的企业级文档视觉解析模型,将复杂文档、表格和图像中的非结构化数据自动转化为 AI 可直接使用的结构化数据。
PostHog Desktop
78The product editor for product builders
PostHog Desktop 是一个面向产品开发团队的多人协作工作区,将产品数据、AI 智能体与代码编辑能力整合,帮助团队基于真实用户数据快速构建、迭代和度量产品。
Nimbia
78AI screen-sharing calls for user onboarding
Nimbia 是一个 AI 驱动的屏幕共享通话产品,能够自动为软件新用户进行交互式引导培训,通过语音对话和实际操控用户屏幕来提升产品激活率与付费转化率。
Agnost AI
78Catch agent failures your evals miss
Agnost AI 通过分析生产环境中 AI 智能体的对话,自动发现静默失败、幻觉、用户流失信号等问题,并将其转化为可执行的评估指标和修复方案。
akta.pro
78Private company data and signals API for the agent economy
akta.pro 是一个私有公司数据与信号 API,为金融服务和 GTM 团队提供比 PitchBook 更深度、更广覆盖的企业数据及 100+ 事件信号,支持交易尽调和精准外呼触达。
OneUptime
78Open source observability with an AI SRE that fixes code
OneUptime 是一款开源可观测性平台,集成 AI SRE 能力,可自动定位故障根因并提交修复代码的 PR,替代 Datadog、PagerDuty、Sentry 等多款商业工具。
bitdrift.ai
78The world’s first agentic mobile observability platform
bitdrift AI 是全球首个代理式移动端可观测性平台,通过 AI 自主查询移动用户行为并实时响应,帮助开发团队将故障平均修复时间(MTTR)提升 10 倍。
Kane CLI
78Natural language browser & mobile app tests from terminal
Kane CLI 是一个面向开发者和 AI 编码代理的命令行测试工具,允许用自然语言描述测试用例,自动在真实 Chrome 浏览器中执行并返回通过/失败结果及可分享的证明截图,无需编写选择器。
GrowthBook 5.0
78Build, ship, and improve at scale
GrowthBook 5.0 是一个开源的 AI 原生实验平台,将功能标志、A/B 测试与产品分析整合为一体,帮助产品和工程团队以更低摩擦从想法快速迭代到数据洞察。
AI Search Console
78Prompt analytics and citation mapping for AI search
AI Search Console 是一款面向 SEO/GEO 团队的 AI 搜索可见性分析工具,帮助用户追踪品牌在 ChatGPT、Claude、Gemini、Perplexity 等 AI 搜索引擎中的提及、排名和引用情况,替代手动截图和电子表格。
Basedash AI Kit
78Ship AI analytics in your product, powered by GPT-5.6
Basedash AI Kit 是一个基于 GPT-5.6 的 AI 分析 API 平台,允许开发者将智能数据分析能力(对话查询、自动洞察、图表渲染)嵌入到自己的产品中,实现客户侧分析功能的快速集成。
Teable 3.0
78AI Spreadsheet for Business
Teable 3.0 是一款 AI 驱动的商业电子表格工具,帮助企业将业务数据转化为 AI 工作流和自定义应用,支持多系统连接与数据迁移。
ZooData
78The data layer for AI agents
ZooData 将任意 URL 转化为结构化 JSON 数据,帮助 AI Agent 以更低的 token 成本获取干净的结构化数据,并提供亚马逊和 TikTok 平台的电商竞品与市场洞察能力。
AgentKey
78One-stop live data marketplace for your agent
AgentKey 是一个一站式实时数据市场插件,让 AI Agent 通过单条命令即可接入搜索、网页、社交、金融、电商、加密货币等多类外部数据源,无需手动集成。
Basedash Actions
78The BI tool that does, not just reports.
Basedash 是一款 AI 驱动的 BI 工具,不仅能回答数据问题,还能直接执行数据库写操作和第三方服务调用(如 Stripe、HubSpot),将数据洞察转化为可审批的自动化行动。
Respan Gateway
78One AI gateway with built-in observability and evals
Respan Gateway 是一个 AI 统一网关平台,通过单一接入点连接 1000+ AI 模型,并内置可观测性、评估、成本控制等能力,解决生产环境中 AI 应用可靠性与多工具碎片化管理的问题。
Vaani
78Lip-synced AI dubbing for creators, brands and studios
Vaani 是一款 AI 配音工具,通过克隆原声、保留音乐并实现帧级唇形同步,帮助创作者和品牌以低成本将视频内容本地化为 40+ 种语言。
Cleo Atlas Legal API
78The world's regulations, machine-readable.
Cleo Atlas 将全球177个司法管辖区的25.6万条法规转化为机器可读的API,帮助企业快速查询和合规管理跨境监管要求。
Veltrix AI
78AI finance copilot for cash flow, margins, and growth
Veltrix AI 是一款面向创始人和财务团队的 AI 财务副驾驶,通过连接 QuickBooks、Xero、Shopify 等主流工具,支持用自然语言查询现金流、利润率和业务表现,替代繁琐的电子表格和静态仪表盘。
Databox MCP
78Chat with your business data inside Claude, ChatGPT and more
Databox MCP 让用户通过自然语言在 Claude、ChatGPT 等 AI 工具中直接查询业务数据(收入、营销活动、销售管道等),打通 BI 数据与 AI 对话界面之间的断层。
Tabbit AI
76Give your browser a task, not just a question
Tabbit AI 是一款具备上下文感知能力的 AI 浏览器,能够理解用户的工作内容,自主执行跨网页任务,并将工作流保存为可复用的「技能」,替代用户完成信息处理与内容生产。
TIM PG
74Anonymize sensitive data before pasting into AI tools
TIM PG 是一款纯离线 Windows 工具,在用户将内容粘贴至 AI 工具前自动脱敏剪贴板中的敏感个人数据,并在 AI 响应返回后无缝还原原始信息,解决使用 AI 工具时的数据隐私泄露问题。
DOJO AI
74AI agents that act on marketing data, not just report it
DOJO AI 是一个营销 AI 智能体平台,通过持续监控付费、自然流量、SEO 和内容渠道,自动执行营销工作流,而非仅输出报告,帮助品牌降低获客成本。
Routines by Databox
74An AI Analyst that runs analysis and reports on a schedule
Routines by Databox 是一款 AI 数据分析师工具,允许用户设定提示词和定时计划,自动分析实时数据并生成报告,通过邮件、Slack 或应用内推送交付,替代手动重复性分析工作。
ALIA
74The data infrastructure for AI that speaks Africa
ALIA 是一个专注于非洲语言与文化的 AI 数据基础设施平台,通过众包模式让组织发布数据任务、贡献者完成任务赚取奖励,从而构建高质量的非洲语言数据集。
ThriveStack citedby
74AI visibility that measures, fixes, and attributes revenue.
ThriveStack Citedby 是一个 AI 可见性平台,帮助品牌衡量、修复并归因于各大 AI 引擎(如 ChatGPT、Perplexity)的引用情况,将 AI 流量转化为可量化的收入渠道。
Staats
74Ask your coding agent how your site is doing
Staats 是一款面向 AI 编程 Agent 的无 Cookie 网站分析工具,开发者无需查看图表,直接通过对话式 Agent 获取站点表现、部署影响与优化建议。
MCP-Builder.ai
74The fastest way to connect your data with your AI Tools.
MCP-Builder.ai 是一个无需代码即可快速构建、托管和保护 MCP 服务器的平台,帮助用户将数据库、API、第三方应用等数据源接入 Claude、ChatGPT、Cursor 等 AI 工具。
Product Analytics for Agents and Users
74Optimize Agent Actions with User Behavior.
Kubit 是一款面向 AI 产品工程师的行为分析平台,通过将 AI Agent 的执行追踪与用户行为数据关联,帮助团队理解并优化 AI 产品的用户体验与留存。
AI Spend Console by Rippling
74Track your AI spend and connect it to business outcomes
AI Spend Console 是 Rippling 推出的 AI 支出管理工具,帮助财务和工程团队统一追踪跨工具的 AI 费用,并将其与 GitHub 等业务产出数据关联,量化 AI 投资回报。
Cleanlist AI
74Natural-language prospecting: find, enrich and sync leads.
Cleanlist AI 是一款面向销售团队的 AI 线索挖掘与管理工具,通过自然语言输入、多源数据富集和一键 CRM 同步,帮助 GTM 团队告别多工具拼凑,快速构建高质量潜在客户名单。
RecipeBook by Shofo
74Buy video training data by the hour featuring 25M+ clips
RecipeBook 是一个视频训练数据平台,允许 AI 开发者通过语义搜索从 2500 万个视频片段中快速筛选、标注并按需购买用于模型训练的高质量数据集,按小时计费,无需销售沟通。
Rivault
74Approve AI agent data access with Face ID
Rivault 是一个零知识安全保险库,专为 AI 智能体提供受控的敏感数据访问(如护照号、信用卡信息),通过 Face ID/Passkey 授权和任务完成后自动销毁数据,解决 AI 自动化执行任务时的隐私与数据安全问题。
Artifacts by Databox
74Ask your AI Analyst and get back a ready-to-share report
Databox 推出的 Artifacts 功能,允许用户通过 AI 分析师对话,将实时数据一键生成可分享的报告、幻灯片或交互式文档。
Adomate
74Turn data into winning ads. At scale.
Adomate 是一款基于数据驱动的广告创意生成工具,帮助营销人员从 Meta 广告账户、广告库及用户评论中提取洞察,批量生成可追溯的品牌广告概念。
Fluree AI
74Give every AI agent trusted context
Fluree AI 为企业应用和 AI 智能体提供统一的可信数据上下文层,通过直接查询结构化数据替代 RAG 猜测,确保每次请求都经过权限校验并返回可溯源的答案。
Agentcard for companies
74Give your agent a debit card
为 AI Agent 提供一次性虚拟借记卡,允许开发者从钱包中划拨固定预算,让 Agent 能够自主完成在线支付,解决 AI 自动化流程中的支付授权与预算控制问题。
Bingeable
74AI agent that turns one prompt into a product tutorial video
Bingeable 是一款面向 SaaS 团队的 AI 视频代理,只需输入一句提示词,即可自动操控真实浏览器完成产品演示流程,并生成带专业配音的教程视频,无需录屏或剪辑团队。
Clusy
74AI notebook platform for modern data science
Clusy 是一个面向数据科学家和研究团队的 AI 原生 Notebook 平台,通过自然语言描述目标即可自动规划工作流、获取数据集、运行并行实验并比较模型,大幅降低 ML 实验的复杂度。
Foresight by Lightning Rod
74Predict anything with AI
Foresight 是一个面向开发者的 AI 预测 API,通过经过真实结果训练和校准的模型,帮助构建智能体、预测市场机器人和决策工具的开发者获取可量化的未来事件预测。
Oxlo.ai
74Scale across AI models without scaling your bill
Oxlo.ai 通过单一 API 接入 35+ 前沿 AI 模型,帮助开发团队在控制成本的前提下灵活切换和比较不同模型,解决 AI 使用账单不可预测的问题。
Latitude
74Fix what's breaking in your AI agent
Latitude 是一个开源 AI Agent 监控平台,自动检测 AI 智能体在规模化运行中的各类失败模式,并为开发者提供修复工具。
BoqCalc
74Bid ready. Risks uncovered. Timeline locked.
BoqCalc 是一款面向建筑工程行业的 AI 投标工具,用户上传工程量清单(BOQ)后,可在 30 分钟内自动生成成本估算、风险分析、施工进度表和现金流预测,大幅压缩传统投标准备时间。
Lium AI
74AI for Complex Data
Lium 是一个面向科学家和分析师的协作式 AI 数据科学平台,允许用户用自然语言提问复杂的真实世界数据集(地理空间、能源、基础设施等),将原本需要数周的工程工作压缩为一次对话。
Minimi
74Your ambient memory for Claude
Minimi 是一款 Mac 端的环境记忆工具,自动捕获用户跨文档、通话、消息和标签页的上下文,并无缝注入 Claude,省去手动粘贴背景信息的步骤。
SwiftXR
72Create interactive 3D, AR and VR experiences with AI
SwiftXR 是一款无需编程、借助 AI 对话即可创建交互式 3D/AR/VR 产品展示体验的 SaaS 平台,帮助电商和品牌提升用户沉浸式购物体验。
AI 数据分析 · KOL 观点
Karpathy提出LLM不应被视为聊天机器人,而应被理解为新型操作系统的内核进程,能够协调多模态输入输出、代码执行、浏览器访问和记忆存储等功能。他将当前主流LLM(GPT、PaLM、Claude、Llama)类比为Windows/macOS/Linux,认为我们正处于一个全新计算范式的早期阶段。将LLM看作聊天机器人,就如同将早期计算机仅视为计算器一样短视。
Karpathy 认为 AI 训练范式正经历第三次转型:从预训练(互联网文本)到监督微调(对话数据),再到如今的强化学习时代(环境交互)。他看好「环境」作为核心训练资产的未来,但对 RL 本身持保留态度,认为奖励函数存在根本性缺陷,人类学习方式远比 RL 高效,真正的突破尚未到来。
Karpathy 提出「循环工程」(Loop Engineering)概念,认为构建长时运行 Agent 的核心瓶颈不是模型智能,而是外部框架(Harness)的设计。他给出了包括角色分离、契约先行、状态持久化、自动重启等九条黄金法则,为多日运行的 AI Agent 开发提供了系统性方法论。
Andrej Karpathy 提出了一套完整的 AI 工程方法论,核心是将上下文窗口视为代码(Software 3.0),用工程化思维(规范设计、差异审查、评估循环)替代随意的 Prompt 尝试。他还推广了并行 Agent 管理模式和 CLAUDE.md 配置文件,构建出一套从世界观到具体工具的完整实践体系。
Anthropic的Claude Code创始人Boris Cherny披露,他已8个月未亲手写过一行代码,完全依靠管理数千个AI Agent完成软件开发工作。截至2026年5月,超过80%合并进Anthropic代码库的代码由Claude自主撰写,代码产出量较年初增长8倍。更值得关注的是,该系统已开始自主浏览GitHub和X寻找下一步构建方向,递归自我改进正在成为现实。
安全研究员 Johann Rehberger 发布了一个针对 Claude Code Opus 5 Auto Mode 的可复现漏洞利用链,通过网页摘要请求实现了 60-80% 成功率的远程代码执行攻击,与 Anthropic 此前声称'基本解决'提示注入问题形成鲜明对比。更值得关注的是,Auto Mode 的安全分类器不仅未能阻止攻击,还主动阻止了模型自身的清理补救操作,形成'倒置失败'。Anthropic 将该漏洞报告关闭为'Informative',称这属于'设计如此'的行为。
安全研究员 Boris Cherny 通过构造多步骤攻击链,成功以 60-80% 的成功率突破了 Claude Code Opus 5 的 Auto Mode 安全防护,实现了代码执行。这与 Anthropic 委托第三方(Trajectory Labs)评估得出的 0.00% 攻击成功率形成直接矛盾。攻击核心在于利用 Python 模块路径劫持(struct.py 影子模块),绕过模型对直接二进制执行的拒绝。
Anthropic 公开了其内部 AI 辅助编程的规模化数据:截至2026年5月,Claude 已负责超过80%的生产代码提交,工程师人均代码产出提升8倍,开放性任务成功率达76%(半年内提升50个百分点)。这是业界首份来自前沿实验室的、基于真实生产环境的 Agentic 编程规模化原始数据报告,而非基准测试或演示。文章提炼了可供工程团队直接参考的工作流模式,如 maker-checker 循环等。
Anthropic内部人员Boris Cherny分享了在生产环境中使用Claude写代码的最佳实践:原型代码可以黑盒处理,但生产代码应设置比人类更高的质量标准。Anthropic内部使用lint规则、自动化测试、Claude驱动的模糊测试、自动代码审查等多重护栏来保障AI生成代码质量。开发者的核心职责是'守住代码质量的标准线'。
Karpathy 提出了一种基于 LLM 的个人知识库构建模式——'LLM Wiki',核心思路是让 LLM 主动维护一个持久化的 Markdown Wiki,而非每次查询时重新从原始文档检索。每当新增信息源时,LLM 负责提取、整合、更新并标注矛盾点,使知识库随时间累积增值。用户负责信息来源与提问方向,LLM 承担所有整理与交叉引用工作,Obsidian 作为可视化 IDE。
桥水基金AI战略负责人Greg Jensen提出'代币税'(token tax)政策构想,旨在应对AI驱动的大规模失业问题。桥水预测未来五年美国将有高达18%的工作岗位被AI取代,Jensen同时就模型能力与安全现状进行了深度评估。这是传统顶级金融机构对AI经济冲击给出的罕见量化预测与政策响应。
Karpathy 指出随着 token 需求的爆发式增长,LLM 底层芯片的内存与计算编排将成为最具价值的技术挑战。核心矛盾在于片上 SRAM(快但容量小)与片外 DRAM(容量大但带宽受限)两种内存池的物理约束,如何在推理/训练等工作负载中实现最优吞吐/延迟/成本比是当前最重要的工程智识难题。他顺势为 MatX 团队的新芯片融资背书,认为其方向切中了现有 NVIDIA(HBM优先)和 Cerebras(SRAM优先)两大阵营均难以同时满足的长上下文 agentic 推理场景。
Andrej Karpathy 与 Sarah Guo 深度对话,探讨 AI 代理(Code Agents)的现状与未来,重点介绍其 AutoResearch 项目——让 AI 代理自主完成实验设计、数据收集和模型优化的闭环研究流程。同时讨论了自然语言编程的二阶效应、AI 时代的相关技能、模型分化(Model Speciation)以及 AI 对就业市场的影响。
安全研究员在Anthropic宣称提示注入问题'基本解决'仅四天后,成功构建了针对Claude Code Auto Mode的间接提示注入攻击链,测试成功率达60-80%。攻击利用Python模块影子覆盖机制,通过多步骤链式操作绕过AI安全检测,最终实现远程代码执行。Anthropic的回应坦承Auto Mode从未被设计为安全边界,仅为便利性功能。
Karpathy 描述了编程范式从「氛围编程」(vibe coding)向「代理工程」(agentic engineering)的演进,提出了 Software 3.0 的概念——通过提示词和上下文而非显式代码来编程。他强调 LLM 如同易错的「幽灵」,需要新型判断力,并指出思考可以外包但理解力永远不能外包。
安全研究员 Johann Rehberger 证明了 Claude Code Auto Mode 存在通过 Python 模块劫持实现远程代码执行的漏洞,成功率高达 60-80%,而 Anthropic 委托的第三方评估却声称该模式零提示注入攻击成功率。Anthropic 将此漏洞披露归类为「按设计运行」,拒绝修复,导致其安全营销宣传与实际漏洞现实之间出现公开矛盾。文章深刻揭示了基准测试覆盖范围与真实攻击面之间的本质差距,以及 AI 分类器「批准命令」与「命令执行结果安全」之间的语义错位。
文章通过一个真实的多实例部署导致重复发邮件的案例,揭示了「氛围式调试」(让AI代理在没有确定性复现步骤的情况下调试)比「氛围式编码」危险得多的原因:AI只能基于症状做模式匹配,从未观测过真实运行时状态,错误的修复猜测不会报错,而是生成看似合理却掩盖真实问题的diff,制造第二个bug。核心建议是:调试前先写出可复现的失败测试,以此作为给AI最好的「prompt」;连续3次失败后重置会话,避免被AI自身的错误推断污染上下文。
Anthropic Claude Code负责人Boris Cherny分享了Claude Code从简单终端原型成长为占GitHub公开提交4%的AI编程工具的历程,并探讨了编程问题被'解决'后的下一步。他分享了反直觉的产品原则,包括刻意缩减团队规模、给予无限token预算,以及AI如何重塑所有专业工作的未来图景。
Claude Code创始人Boris Cherny分享了AI编程工具的构建历程与工作流实践,包括每天并行运行5个Claude实例提交20-30个PR的高效模式。他深入探讨了AI时代软件工程师角色的演变——编码门槛降低,但工程师的职责边界正在向产品、设计等领域扩展融合。
Spotify首席架构师Niklas Gustavsson分享了公司在AI编程领域的前沿实践:73%的PR已由AI生成,任何人都能在1-2小时内完成原型开发。对话探讨了IDE的终结、AI代理处理2000万行代码的经验,以及异步编程工作流的组织变革。
Claude Code创始人Boris Cherny建议用户每6个月清空一次AI指令文件(如CLAUDE.md),因为底层模型持续升级后旧指令可能反而成为限制。他强调验证机制比提示词工程更重要,并指出Opus 5已大幅增强对提示注入的抵御能力,智能体可连续工作数天甚至数月。Anthropic内部每天运行20-30个Claude例行任务用于代码维护,标志着AI工作流进入新阶段。
Riley Brown 展示了如何以 Codex 为操作系统运营 150 万粉丝的单人内容创业,核心方法论是将每个重复性工作流封装为可复用的 Skill,形成难以复制的个人护城河。文章从工程架构层面拆解了 Codex 与 ChatGPT 的本质差异(本地存储 + computer use),并通过 Remotion、SerpAPI 等具体工具链演示了 Skill 驱动的内容生产流程。
Anthropic工程师Boris Cherny(Claude之父)分享了一项实验:让Claude自主维护其应用程序,在数周内提交了388个完全由AI编写的PR,其中180个已被合并。工程师唯一的工作是点击按钮决定是否合并代码。该实验覆盖iOS、Android、桌面、Web、CLI和Agent SDK六个环境,Claude每日自动执行崩溃检测、重复代码合并、死代码清理等任务。
Andrej Karpathy 是前 Tesla AI 总监、OpenAI 联合创始人,其博客涵盖深度学习原理、强化学习、比特币底层实现及 AI 科幻短篇等内容。文章风格以从零实现、深度教程为主,兼具学术严谨性与工程实用性。博客内容跨越多年,记录了深度学习领域从早期 RNN 到现代 GPT 的演进轨迹。
Riley Brown 分享了他如何用 Codex 等 AI 工具运营 150 万粉丝内容业务的完整工作流,涵盖选题研究、缩略图设计、脚本撰写到视频制作全流程。他的核心理念是用 AI 消除重复性工作,将节省的时间投入到提升内容质量,而非批量生产内容。护城河在于长期持续的高质量输出,而非 AI 加速的数量堆砌。
Andrej Karpathy在2025年2月创造了'vibe coding'概念,描述低审查的AI辅助编程方式。到2025年12月,他80%的代码已由AI生成,并于2026年4月宣布vibe coding已过时,取而代之的是他称为'agentic engineering'的更严格工程纪律。这一18个月的思维演变代表了专业软件开发的未来走向。
Anthropic工程师Boris Cherny披露,Claude已在Anthropic内部软件上运行每日自动维护任务数周,共创建388个PR,其中180个经人工审核后被合并,合并率达46%。该系统通过Slack频道协调,覆盖iOS、Android、桌面、Web、CLI及Agent SDK等全平台。
Anthropic工程师Boris Cherny分享了一个实验:让Claude自动承担应用日常维护工作,包括崩溃检测修复、重复代码统一、死代码清理等,数周内提交388个PR,180个被合并。这一工作流展示了AI Agent在软件工程自动化维护领域的实际落地潜力。
Claude Code创始人Boris Cherny透露,Anthropic在Opus 5发布时删除了超过80%的系统提示词,因为新模型已能自主完成旧模型需要纠正的行为。他建议用户每六个月清空一次CLAUDE.md和技能配置重新测试,核心结论是:保留'不变量'(导航上下文、业务信息),删除'程序'(任务执行步骤),让更强的模型自主决策。