Thread By @karpathy - With many 🧩 dropping recently, a...
高潜力 92
Andrej Karpathy · Mon Aug 17 2026 08:00:00 GM
Karpathy提出LLM不应被视为聊天机器人,而应被理解为新型操作系统的内核进程,能够协调多模态输入输出、代码执行、浏览器访问和记忆存储等功能。他将当前主流LLM(GPT、PaLM、Claude、Llama)类比为Windows/macOS/Linux,认为我们正处于一个全新计算范式的早期阶段。将LLM看作聊天机器人,就如同将早期计算机仅视为计算器一样短视。
核心观点 - – LLM应被理解为新操作系统的内核进程,而非聊天机器人
- – LLM已能协调多模态I/O、代码解释器、浏览器访问、嵌入式数据库等核心能力
- – 当前LLM运行类似单线程执行,约10 token/s,可类比汇编级执行追踪
- – 计算机安全概念(攻击、防御、漏洞)同样适用于LLM生态
- – 主流LLM格局类比操作系统市场:GPT/PaLM/Claude/Llama对应Windows/macOS/Linux
- – OS有默认应用和应用商店,大多数应用可跨平台——LLM生态将遵循同样逻辑
- – 我们正处于全新计算范式的极早期阶段
LLMAI基础设施操作系统计算范式AI Agent分析预测技术趋势
388 Fully AI-Authored PRs (180 Merged) – Claude Creator Claims Programmers’ Only Remaining Task Is Signing Off
高潜力 88
Boris Cherny · Mon Aug 17 2026 16:40:51 GM
Anthropic工程师Boris Cherny(Claude之父)分享了一项实验:让Claude自主维护其应用程序,在数周内提交了388个完全由AI编写的PR,其中180个已被合并。工程师唯一的工作是点击按钮决定是否合并代码。该实验覆盖iOS、Android、桌面、Web、CLI和Agent SDK六个环境,Claude每日自动执行崩溃检测、重复代码合并、死代码清理等任务。
核心观点 - – AI已能自主完成完整的软件开发闭环:识别问题→修改代码→提交PR→等待审核
- – 388个AI编写的PR中180个被合并,合并率约46%,说明AI代码质量已达到可用水平
- – 程序员角色正在向'审批者'转变,核心工作从写代码变为判断代码是否合格
- – 该实验在Anthropic内部运行数周,具有一定的可信度和可复现性
- – Claude被要求不能用模拟器作弊,必须运行真实应用,体现了AI自主工作的约束设计
AI编程软件工程自动化ClaudeAnthropicAI Agent开发者工具预测分析
Claude Code now runs daily maintenance on Anthropic's software with a 46 percent merge rate
高潜力 88
Boris Cherny · Fri Aug 14 2026 19:44:38 GM
Anthropic工程师Boris Cherny披露,Claude已在Anthropic内部软件上运行每日自动维护任务数周,共创建388个PR,其中180个经人工审核后被合并,合并率达46%。该系统通过Slack频道协调,覆盖iOS、Android、桌面、Web、CLI及Agent SDK等全平台。
核心观点 - – Claude已实现生产级别的自主软件维护,46%的PR合并率证明其实用价值
- – 通过Slack(Tag集成)作为任务调度入口,形成人机协作的代码维护工作流
- – 覆盖六大平台的12项日常维护例程,将开发者从重复性维护工作中解放
- – Anthropic将自身产品作为AI能力的试验场(eating own dog food),具有强烈的信号意义
- – 46%合并率意味着超过一半的PR仍被拒绝,人工审核环节依然关键
AI编程工具自主AI代理软件工程自动化ClaudeAnthropic企业AI落地分析
Riley Brown 用 Codex 跑 1.5M+ 粉丝内容生意:把每个反复干的活变成 Skill,是单人内容创业的真护城河 - Text Matrix
高潜力 88
Riley Brown · Wed Aug 19 2026 08:00:00 GM
Riley Brown 展示了如何以 Codex 为操作系统运营 150 万粉丝的单人内容创业,核心方法论是将每个重复性工作流封装为可复用的 Skill,形成难以复制的个人护城河。文章从工程架构层面拆解了 Codex 与 ChatGPT 的本质差异(本地存储 + computer use),并通过 Remotion、SerpAPI 等具体工具链演示了 Skill 驱动的内容生产流程。
核心观点 - – Codex 的核心优势不是对话能力,而是本地存储 + computer use 的架构组合,这是 agent 落地的基础设施前提
- – 将重复工作封装为 Skill(如 Remotion best practices)是单人内容创业的真正护城河,而非工具本身
- – 评估 agent 平台时「是否支持本地存储」比「上下文窗口大小」更关键,前者决定 computer use 能否落地
- – 内容分发采用「YouTube 为创作枢纽 + Instagram/TikTok/X 做 native 内容」的多平台分层策略
- – SerpAPI + Internet Image Puller 等 Skill 组合可将素材准备从人工外包转为自动化流程
AI工具内容创业单人团队工作流自动化CodexAgent创作者经济分析教程
🚨 Head of Claude Code, Boris Cherny: I'm not prompting my agents anymore, I'm building graphs and loops so they can build the agents for me.
高潜力
Boris Cherny
Claude Code负责人Boris Cherny分享了智能体工程的最新演进:开发范式已从人工提示单个Agent,转变为构建Agent图谱和循环,让Agent自动生成并调度其他Agent。这一'Agent提示Agent'的多层组织架构代表了过去三个月内正在发生的第二次重大跃迁。
核心观点 - – 开发范式转变:从人工提示Agent → Agent提示Agent的多层组织架构
- – 两次技术跃迁:第一次是模型能快速生成全部代码;第二次(当前进行中)是Agent自主协调其他Agent
- – Anthropic内部长期聚焦企业级编程场景,Claude Code源于Anthropic Labs原型团队的产品化尝试
- – 模型能力进化速度极快,产品侧往往滞后于模型实际能力,存在巨大的产品机会窗口
AI Agent智能体工程Claude Code多Agent系统LLM应用开发预测分析
Anthropic's Claude Code merges 46% of its own maintenance PRs — AI Insiders
高潜力 82
Boris Cherny · Sat Aug 15 2026 08:00:00 GM
Anthropic工程师Boris Cherny让Claude在无人逐一指令的情况下自主运行数周,对公司内部多个应用代码库提交了388个PR,最终46%被合并。这一实验展示了AI自主维护代码库的早期可行性,但也暴露出超过半数PR被拒绝的质量问题,以及审查成本尚未量化的关键缺口。
核心观点 - – Claude在无人逐一触发的情况下自主生成388个PR,覆盖iOS/Android/Web/CLI/Agent SDK等多个代码库
- – 46%合并率(180/388)意味着机器产出量远超人工,但多数提案被拒,质量稳定性存疑
- – 任务类型高度结构化:崩溃修复、重复代码合并、死代码清理、不稳定测试修复等约12类例行维护
- – 调优方式是修改routine指令而非手动改代码,形成一种'提示工程即运维'的新范式
- – 关键数据缺失:208个被拒PR的审查人工成本未被量化,净收益结论尚不确定
- – Anthropic正在探索加速机械性变更的审查流程,暗示下一步是降低人工介入门槛
AI Agent代码自动化软件工程AnthropicClaude自主AI开发工具案例分析
An LLM wiki changed how I work
高潜力 82
Andrej Karpathy · Wed Aug 19 2026 08:00:00 GM
Andrej Karpathy 提出用 LLM 构建个人知识库(wiki)的工作流:将源文档存入本地文件夹,由 LLM 提取整理成持续更新的 Markdown wiki。作者亲测后认为这是今年最有效的生产力工具,适合需要研究助手的知识工作者。文章同时涵盖了作者年度生产力工具盘点。
核心观点 - – Karpathy 提出 LLM wiki 方法:本地文件夹 + LLM 自动提取整理为 Markdown 格式的个人知识库,随新材料持续更新
- – 该方法迅速引发社区跟进,GitHub、YouTube、Substack 上出现大量复现教程,说明需求共鸣度极高
- – 作者实测认为是年度最佳生产力改进,但强调需要一定维护成本,并非零门槛
- – Raycast 等 AI 增强型启动器工具持续被验证为高价值生产力工具,GPT-5.5 Instant 被用于日常快速 AI 查询
- – 'Vibe coding' 创造者 Karpathy 的方法论具有强烈的传播效应,一条推文即可引爆社区跟进
LLM应用个人知识管理生产力工具AI工作流教程评论
How I Run My 1.5M+ Follower Content Business With Codex | Riley Brown - Behind the Craft | Lyssna här | Poddtoppen.se
高潜力 82
Riley Brown · Sun Aug 16 2026 08:00:00 GM
Riley Brown(150万+粉丝AI创作者)分享了如何用Codex构建一人百万美元内容业务的完整AI工作流,涵盖缩略图生成、视频钩子写作、B-roll动画制作等环节。他提出了BRENS框架用于将创意转化为强力钩子,并展示了如何设置AI代理主动发掘内容选题。
核心观点 - – 使用Codex作为核心工具运营完整内容业务,覆盖从选题到发布的全流程
- – BRENS框架:将创意结构化转化为高吸引力视频钩子的方法论
- – Codex可逆向工程分析顶级YouTube钩子,辅助内容策略
- – AI代理可主动(proactively)发现内容选题,而非被动等待指令
- – 一人公司通过AI工具栈实现高频内容产出,包括图表、缩略图、社媒帖子
AI工具内容创业一人公司创作者经济AI Agent教程工作流
GREG ISENBERG (@gregisenberg) “The question I get most right now is "what should I turn into an AI agent?" Here” — TopicDigg
高潜力 82
Greg Isenberg · Fri Aug 14 2026 08:00:00 GM
Greg Isenberg 提出了一个判断「什么适合做成 AI Agent」的五步测试框架:重复触发、稳定输入、明确工具、可衡量终点、中间有判断。其中第五点「中间有判断」是区分 Agent 与普通自动化的核心标准。
核心观点 - – Agent 适合的任务需满足:重复触发、稳定输入、工具明确、有可衡量的完成标准
- – 「中间有判断」是 Agent 区别于简单自动化的本质特征——每次运行需要实时决策
- – 前四个条件回答「能否自动化」,第五个条件回答「是否需要 Agent」
- – 该框架适用于 Claude、Codex、Grokbot 等主流 AI 工具的场景评估
AI Agent自动化框架方法论分析创业工具
The question I get most right now is "what should I turn into an AI agent?". Here is the 5 part test I use (works for Claude/Codex/Grokbot etc): | Greg Isenberg
高潜力 82
Greg Isenberg · Fri Aug 14 2026 08:00:00 GM
Greg Isenberg提出了一个判断'什么任务适合转化为AI Agent'的5步测试框架:重复触发、稳定输入、明确工具、可衡量终点、中间需要判断力。其中第5点'判断力'是区分Agent与普通自动化的核心标准。评论区进一步补充了异常处理和错误代价的重要性。
核心观点 - – 适合Agent化的任务需满足5个条件:重复触发、稳定输入、工具明确、有可衡量的完成标准、执行过程中需要实时判断
- – 前4个条件判断任务是否'可自动化',第5个条件(中间判断力)才是区分Agent与脚本/简单自动化的本质差异
- – 评论补充第6个维度:Agent判断失误时的处理机制(异常路径、回退机制、人工接管)决定了其在真实工作流中的可信度
- – 另有观点指出输入稳定性和触发条件可以适当放宽,但工具集的明确性和安全审计非常关键(防止注入攻击和成本失控)
- – 该框架适用于Claude、Codex、Grok等主流AI平台的Agent设计决策
AI Agent自动化创业工具产品决策框架方法论分析教程