Andrej Karpathy 分享了其个人AI工作流方法,核心包括:使用语音转文字工具(Super Whisper)提升交互效率、构建个人'LLM Wiki'知识库提升AI输出精准度、将静态文档转化为交互式工具,以及多AI智能体协同编排复杂任务。整体目标是通过系统化AI整合实现10倍生产力提升。
AI 语音
TTS、ASR、语音克隆、AI 配音、对话语音
AI 语音 · 精选产品
Ojin
83Talk to an AI Agent with a real face and voice, in real time
Ojin 提供带有真实面孔和声音的 AI 智能体 API,支持实时打断式自然对话,只需一张照片即可创建可交互的数字人形象。
GPT-Live
82Full-duplex voice for ChatGPT
GPT-Live 是 OpenAI 为 ChatGPT 推出的全双工语音模型,支持同步听说、自然处理停顿与打断,解决了传统语音助手交互不自然、延迟高的问题。
Devin Voice
80You say it, Devin ships it
Devin Voice 是 Cognition AI 为其 AI 软件工程师 Devin 推出的语音交互界面,用户只需开口说出需求,Devin 即可自动规划、编码并交付软件成果。
Gemini 3.5 Transcribe
78Our most precise speech-to-text model yet
Google推出的最新高精度语音转文字模型,专为实时精准转录场景设计,是Gemini系列在语音识别领域的延伸。
Memoria
78Search photos by text, speech, object & faces. 100% offline.
Memoria 是一款完全离线的本地相册智能搜索引擎,利用设备端 AI 实现通过文字、语音、物体和人脸搜索照片和视频,无需云端或订阅。
Wispr Flow Notetaker
78Meeting notes that get the details right.
Wispr Flow Notetaker 是一款 Mac 端 AI 会议记录工具,能自动识别发言人姓名、同步用户术语库,并支持通过 MCP 将会议记录直接导入 Claude 或 ChatGPT,让会后跟进更准确高效。
Megaphone
78Open-source Mac dictation App that's 100% on-device
Megaphone 是一款完全本地运行的 Mac 开源听写应用,无需账号或订阅,按住 Fn 键即可将语音转化为干净文本输入任意应用。
River
78AI account executives that demo and close B2B deals
River 是一款 AI 销售代表产品,能够在 B2B 潜在客户询盘时立即接入通话、完成产品演示并处理异议直至成交,解决销售团队日历排期导致的线索流失问题。
Lispr
78Hold a key, speak, and Lispr writes it anywhere
Lispr 是一款免费的 Mac/Windows 语音听写与实时翻译工具,按住快捷键即可将语音转文字输入到任意应用,支持 99 种语言识别和 32 种语言翻译,无需账号、无需下载模型。
Universal-3.5 Pro
78Native code switching, better diarization, more languages.
AssemblyAI 推出的新一代语音转文字模型,支持18种语言无缝切换、高精度说话人分离,面向开发者提供实时与异步两种API接入方式。
Cotypist
78Local AI Autocomplete in your voice, anywhere on your Mac
Cotypist 是一款运行在 Mac 本地的 AI 自动补全工具,无需联网即可在 Mail、Slack、Notes 等任意应用中提供实时文字续写建议,解决用户在写作时需要频繁切换 AI 工具的效率问题。
Asmi AI
78AI that handles your personal chores in the real world
Asmi 是一个 AI 语音助理,每天早晨主动致电用户了解待办事项,然后代替用户拨打电话处理日常杂务(预约、沟通、等待接听),并通过 iMessage 或 WhatsApp 汇报结果。
Vaani
78Lip-synced AI dubbing for creators, brands and studios
Vaani 是一款 AI 配音工具,通过克隆原声、保留音乐并实现帧级唇形同步,帮助创作者和品牌以低成本将视频内容本地化为 40+ 种语言。
Microsoft MAI-Voice-2
78Expressive TTS with voice cloning in 15 languages
微软推出的高表现力语音合成模型,支持短样本声音克隆与15种语言情感控制,面向生产级语音智能体开发者。
Cignara
78AI Agents for Fortune 500 grade customer support
Cignara 为企业提供具备严格策略治理的 AI 客服代理,支持语音与文字全渠道对话,主打零幻觉、可验证的客户服务自动化。
VaniQ
74Mac dictation that spells your code identifiers right
VaniQ 是一款面向 Mac 开发者的本地语音听写工具,通过预读代码仓库来正确识别并拼写代码标识符,彻底解决通用听写应用将变量名/函数名转录错误的痛点。
Loqua
74Speak naturally and move from thoughts to being done
Loqua 是一款 AI 语音生产力工具,让用户通过自然语音将想法直接转化为可用内容,并支持屏幕理解、朗读、翻译、编程等工作流,减少打字与上下文切换。
Desert Ant Labs
74Small specialized AI models for speech, text, vision
Desert Ant Labs 提供可在手机或浏览器本地运行的小型专用 AI 模型(语音、文本、视觉),无需联网、无按次计费,通过统一 SDK 几行代码即可集成。
Aloud
74Turn spoken feedback into tasks your coding agent can run
Aloud 是一款 Mac 工具,将用户的语音反馈和屏幕录制转化为结构化任务,直接驱动 Claude、Cursor 或 Codex 等 AI 编程代理执行。
SKI
74Free voice coding for Claude Code, Codex and more
SKI 是一款免费的桌面端语音编程工具,让开发者可以用语音与 Claude Code、Codex 等 AI 编程助手实时对话协作,像和真实队友交流一样构建代码。
Bolna Agent Studio
74Build Voice AI Agent in 10 Minutes
Bolna Agent Studio 是一个无代码平台,让任何企业能在10分钟内构建并部署生产级语音AI客服代理,无需提示词工程经验。
Scriptly
72An iOS teleprompter app controlled by your voice
Scriptly 是一款 iOS 提词器应用,通过实时语音跟随滚动技术,帮助内容创作者轻松撰写、整理脚本并录制视频。
LikhLo AI: Voice Khata & Ledger
72Voice-first AI khata & ledger for 63M+ merchants
LikhLo AI 是一款面向印度6300万小微商户的开源语音优先记账工具,支持用Hinglish口语记录赊账、发送WhatsApp催款提醒并生成UPI收款码,完全本地运行保护隐私且零订阅费用。
Kekoso
72On-device dictation and transcription for your Mac
Kekoso 是一款运行在 Mac 本地的语音听写与音频转录工具,支持多种 AI 引擎,完全离线无需联网,一次性付费保护隐私。
Loqua
72Speak naturally. Move from thoughts to done.
Loqua 是一款语音优先的 AI 生产力工具,让用户通过自然语音完成写作、翻译、屏幕理解、日程安排和编程等工作流,减少打字和上下文切换。
ThunderPhone
72A self-serve platform for building AI phone agents
ThunderPhone 是一个自助式 AI 电话客服代理构建平台,帮助企业低成本搭建和管理智能语音代理,支持通话模拟测试、实时监控与多语言服务。
Speko
72OpenRouter for Voice
Speko 是一个统一的语音 AI API 网关,整合了语音转文字、大语言模型和文字转语音能力,并提供公开基准测试与实时可用性监控,让开发者无需对接多个服务商即可构建完整语音应用。
Tellie Prompter 1.5
72The teleprompter that knows what you haven't said
Tellie Prompter 是一款智能提词器 Mac 应用,能实时监听用户发言并自动跟踪进度,支持即兴发挥、跳段和超时提醒,无需账号、本地运行。
FreJun Teler
72Programmable voice calling infra for developers
Teler 是 FreJun 面向开发者的可编程语音基础设施平台,帮助开发者快速构建 AI 语音应用、电话智能体和通信工作流。
AuraScribe
72Free, offline voice dictation for Windows, macOS & Linux
AuraScribe 是一款免费开源的离线语音听写工具,支持 Windows/macOS/Linux,按下快捷键即可将语音转为文字输入到任意应用,全程本地处理,无需账号和订阅。
Murmur
72Private Mac TTS: 860+ voices, cloning, no subscription
Murmur 是一款运行在 Apple Silicon Mac 本地的私密文字转语音工具,提供 860+ 声音、声音克隆和无订阅的一次性买断模式。
Vois 2.0
72The ElevenLabs alternative with unlimited generation
Vois 2.0 是一款桌面端文字转语音工具,以无限生成次数、无字符计费的订阅模式对标 ElevenLabs,支持100+声音、声音克隆、多说话人时间轴及CLI接口,适用于有声书、播客、YouTube视频等内容创作场景。
Whisperstream
72Local AI dictation for Windows
Whisperstream 是一款 Windows 本地 AI 语音听写工具,通过按键说话将语音转文字粘贴到任意窗口,所有处理在本地 CPU 完成,音频不上传云端,保护隐私。
ElevenLabs MCP in Claude
72Create and manage ElevenLabs voice agents in your chat
ElevenLabs MCP 允许用户在 Claude 聊天界面中直接创建和管理 ElevenLabs 语音智能体,实现 AI 对话与语音代理的无缝集成。
Clinitraq.ai
72The AI operating system for medical & dental practices
Clinitraq.ai 是面向医疗和牙科诊所的 AI 操作系统,通过 AI 语音智能体实现 24/7 接听电话、预约挂号、保险核验和账单处理,帮助诊所降低前台与账单成本 30-40%。
Gotcha
72World's First AI Copilot for Android. You talk. It acts.
Gotcha 是一款免费开源的 Android 端侧 AI 语音助手,允许用户通过自然语言控制手机,支持 100+ 原生设备操作和实时语音通话。
AI Group Call
72Type a goal, join a live voice call with six AI minds
用户输入目标后,立即加入一场由6个AI角色参与的实时语音群聊,AI们会相互辩论、轮流发言,并生成会议摘要和行动项,帮助用户快速梳理思路、推进决策。
Sonora
72Speak. The text writes itself.
Sonora 是一款免费开源的跨平台语音听写工具,用户按下快捷键即可将语音实时转为文字并输出至光标位置,解决了手动输入效率低下的问题。
SpeakoFlow
72Open-source local voice assistant for your desktop
SpeakoFlow 是一款开源的本地桌面语音助手,允许用户通过语音在任意应用中输入文字、生成回复并与屏幕内容交互,全程数据可本地运行保护隐私。
Hand Wave
72Turn sign language into speech with smart glasses
Hand Wave 利用 Meta 智能眼镜的摄像头将手语实时转换为文字和语音,帮助听障/语障人士跨越沟通障碍。
Bolcho AI
72Build Voice AI agents that actually speak India
Bolcho AI 是专为印度市场打造的多语言 AI 语音代理平台,帮助企业快速构建、部署和扩展支持本地语言的电话与网页语音客服机器人。
Laxis
72Make meeting notes awesome, type 4x faster, translate live
Laxis 是一款 AI 会议助手,支持无 Bot 方式录制和摘要会议,并提供 100+ 语言的实时转录与翻译,同时内置语音听写功能,帮助专业人士更高效地记录会议内容和撰写邮件。
Yap
72Open-source voice dictation for Mac, fully on-device
Yap 是一款免费开源的 Mac 本地语音听写工具,通过快捷键即可将语音实时转为文字并粘贴到任意输入框,完全离线运行,无需下载模型,数据不离开本机。
Epilude
72Local voice dictation for Mac for polished text
Epilude 是一款 Mac 本地语音听写工具,用户按住按键说话即可在任意应用中获得经过润色、标点修正和语气匹配的文本,全程离线运行保护隐私。
Phantom
72Voice-first AI agent that operates your Mac
Phantom 是一款 macOS 语音优先 AI 助手,通过刘海区域随时唤起,无需切换窗口即可在当前工作流中直接执行任务。
Leaping AI
72AI agents that call and text in multi-day campaigns
Leaping AI 为家装、屋顶、建筑等实体行业提供 AI 驱动的自动化电话与短信代理,帮助企业跨多周运行多线程销售与客服campaigns,彻底消除漏接电话和跟进不足的问题。
AI YC interview with Gstack agents
72AI specialists that join your Google Meet and gives feedback
一个开源工具,让多个 AI 专家角色(CEO、CSO、YC 合伙人等)以语音机器人和 3D 虚拟形象的方式加入你的 Google Meet,模拟 YC 面试场景并实时提供反馈。
Openbase
72Manage your team of AI agents by voice, from anywhere
Openbase 让开发者通过语音在手机上远程管理 AI 编程 Agent 团队,无需盯着屏幕即可派发任务、审批代码变更和推送 PR。
Diction
72Type and edit 5x faster with your voice in any app.
Diction 是一款 iOS 语音键盘应用,支持在任意 App 中以语音输入和编辑文字,速度提升5倍,且全程本地处理、零数据收集,解决了移动端打字效率低与隐私泄露的双重痛点。
Speech To Markdown
72Harness local AI for notes
一款免费的 macOS/iOS 应用,利用本地 LLM 将语音转换为结构化 Markdown 笔记,全程离线无需云端。
Heard
72Give Claude Code and Codex a voice
Heard 是一款 macOS 语音层工具,将 Claude Code、Codex、Cursor 等 AI 编程代理的输出转化为智能语音摘要,让开发者在不盯屏幕的情况下也能掌握多任务并行进展。
OpenCode Superapp
72The power of Codex with local, self-hosted models and voice
OpenCode Superapp 是一款面向开发者的本地优先 AI 编程代理工具,支持云端、本地和自托管模型,通过语音交互、文件/Git/终端操作及 Mac 应用控制,提供兼顾隐私与灵活性的 Codex 级别智能编程体验。
Wispro
72Stop typing, start talking, get perfectly written text
Wispro 是一款 AI 语音转写工具,将口语实时转化为干净、可直接使用的文字,支持精准转录、智能润色和语音指令生成三种模式。
Hitoo
72Speak all languages in your own voice, in real time
Hitoo 是一款实时语音翻译工具,能在保留用户原声音色的同时,跨越50+种语言传递语调、意图与文化语境。
Universal Dictation on Stream
72Private Voice Ring for dictation across iOS & Mac
Stream 是一款跨 iOS 和 Mac 的语音戒指硬件产品,通过按压即说实现无缝语音听写,解决用户在多设备间切换输入的效率问题。
Routine AI
72Control work with your voice. The Siri for work.
Routine AI 是一款语音驱动的工作效率工具,让用户通过自然语言控制任务、日历、笔记和项目管理,相当于职场版 Siri。
VocalVia
72Turn documents and articles into editable multi-voice audio
VocalVia 将 PDF、Word、Markdown 等文档转换为可编辑的多声部播客音频,让用户随时随地收听长篇内容,解决了阅读屏幕疲劳和碎片化时间利用的问题。
Simba Voice Agents
72Voice agents powered by Simba 3.2 the world's #1 voice model
Simba Voice Agents 是 Speechify 推出的语音智能体开发平台,基于其自研 Simba 3.2 语音模型,帮助开发者快速构建具备超低延迟、实时流式传输和情感表达能力的生产级语音 Agent。
Nparla
72Real-time voice interpreter, private, on your Mac
Nparla 是一款运行在 Mac 本地的实时语音口译工具,让用户在 Zoom、Meet、Teams 等会议中无需联网即可实现多语言实时语音翻译,保护隐私。
Hovor
72Voice dictation that works offline, in your language
Hovor 是一款支持离线运行的语音听写工具,可在 Mac 和 iPhone 上将语音实时转为格式化文本,保护隐私的同时支持多语言和个人词典。
AI 语音 · KOL 观点
Andrej Karpathy(OpenAI联合创始人、特斯拉AI总监)分享了7个提升AI使用效率的非常规技巧,核心理念是将AI视为协作伙伴而非搜索引擎。关键方法包括:用语音转文字替代打字、为AI构建个人知识Wiki、以及用大任务驱动AI而非小查询。这些方法使其工作效率提升约10倍。
Greg Isenberg 梳理了当前 AI 重塑创业格局的十大关键信号,涵盖 Agent 经济、语音 AI、开源模型、移动应用复兴、软件定价模式转变及机器人落地等维度。核心判断是:AI 带来的不是渐进式改良,而是商业底层逻辑的系统性重写。创业者若不迅速建立 AI 认知与实操能力,将面临结构性淘汰风险。
Greg Isenberg 列出了 AI 时代的 11 个核心趋势信号,涵盖 Agent 经济、Voice AI、移动端复兴、开源模型崛起、软件定价重构以及机器人硬件爆发。核心论点是:AI 正在重写互联网、商业和劳动力的底层逻辑。对创业者而言,这份清单既是机会地图,也是时间窗口警示。
Andrej Karpathy 分享了一种与 LLM 交互的新模式:用语音进行10分钟的意识流独白,让 LLM 从混乱输入中重建清晰思路,从而实现更好的「心灵契合」。该方法引发了关于效率提升与认知退化之间的讨论——Jerry Liu 指出过度依赖 AI 整理思维可能削弱自身写作和思考能力,并建议在阅读 LLM 输出后手动整理要点。
Andrej Karpathy提出'Prompting 2.0'技术:在开始新项目时,通过10分钟的语音'漫谈'(stream of consciousness)向Claude提供大量上下文,而非精简指令。这与传统提示工程理念相反,利用现代LLM强大的理解能力,将杂乱输入重构为清晰输出,从而减少后续反复修改的次数,大幅提升整体效率。
Greg Isenberg 列举了15个当前并行发生的AI技术变革信号,涵盖Agent经济、语音AI、开源模型、机器人硬件等领域。他的核心论点是:这些变革中任何一个单独出现都足以定义一个十年,而它们正在同时发生。这对创业者而言意味着史无前例的机会窗口。
Riley Brown 详细演示了其用于构建年收入20万美元以上软件公司的完整 Vibe Coding 工作流,涵盖多智能体协同(Claude Code、Codex、GPT 5.5)、Git worktrees 避免冲突、语音转文字提示、以及从数据库到AWS生产部署的全栈开发流程。视频以实际项目 BridgeBench V3 为例,展示了在不手动写一行代码的情况下交付生产级软件的可行路径。核心价值在于其系统化的多Agent任务分级与切换策略。
Greg Isenberg 列举了17个基于 GPT Realtime 2.0 才得以实现的创业方向,涵盖法律、医疗、金融、销售等垂直领域。核心论点是实时语音 AI 的低延迟、多工具并行调用和长上下文能力,开启了此前技术上不可行的产品形态。文章以具体场景驱动,偏向创业选题启发而非技术深度分析。
作者通过分析自己视频下的评论发现,'Vibe Coding'这个词没有统一定义,每个开发者根据自身技术水平赋予它不同含义。文章追溯了该词由Karpathy创造时的原始语境(语音交互、一次性项目),指出该词在传播过程中被不同群体填充了各自的理解,本质上描述的是一种实践与实践者水平之间的关系,而非某种固定行为。
Karpathy认为AI输出格式应从Markdown进化到HTML,HTML支持交互元素、SVG图表、CSS样式等,能将线性文本转化为可浏览、可操作的视觉文档。他进一步提出AI输出的终极形态是可探索的交互式场景,并指出人类偏好语音输入但偏好视觉化输出。
Andrej Karpathy 分享了「10分钟漫谈法」:对AI进行无结构的意识流语音输入,让LLM自动推断并整理出比原始输入更清晰的结构化内容。Claude Code 的 /voice 指令支持多平台、20种语言且不消耗token,是低门槛提升AI上下文质量的实用技巧。
Andrej Karpathy 提出一种语音提示技巧:在正式写提示词之前,先对AI连续口头输入约10分钟的碎片化想法,无需组织语言。LLM能从这些零散表达中提炼出真实目标,并通过多轮追问将独白转化为结构化访谈。这种方式能提供更多上下文,从而减少后续修正次数。
Karpathy 建议用户放弃精心打磨 prompt,转而开启语音模式自由讲述10分钟,让 AI 自行整理碎片化思路。核心逻辑是:LLM 需要足够的上下文才能准确理解用户意图,而意识流式输入比结构化 prompt 更能传递完整背景。这一观点将 prompt 优化的负担从人转移给了模型本身。
Andrej Karpathy 建议用户放弃花费大量时间精心打磨文字提示词,转而使用语音模式自由讲述约10分钟,即使内容零散也无妨。他认为语音带来的大量上下文信息能帮助AI更准确理解用户真实意图,从而减少后续修正的需要。此观点与OpenAI近期大力推进语音交互功能的战略方向高度吻合。
Andrej Karpathy 认为与 AI 交互时,自然随意的长篇口语表达比精心设计的提示词更有效。他建议用户切换到语音模式,自由表达想法,即使思路散乱,现代 LLM 也能理解意图并整理出清晰回应。这一观点挑战了「提示词工程」的必要性,强调上下文充分比措辞精准更重要。
Andrej Karpathy 建议用户不必精心设计提示词,而是直接用语音模式对 AI 进行长达10分钟的自由、混乱的意识流独白。他认为这种方式能给 LLM 提供足够的上下文信息,帮助 AI 更准确理解用户意图,从而减少后续的反复纠错。
Andrej Karpathy 建议用户不必过度雕琢提示词,他习惯开启语音模式对 LLM 随意倾诉约10分钟,并提前告知模型自己的思路可能混乱。这种'随意输入'的交互方式暗示现代 LLM 已具备足够的语境理解能力,用户无需追求结构完美的提示词。
Andrej Karpathy 主张与 AI 交互时无需精心设计提示词,自然口语化的表达反而效果更好。他偏好用语音模式与 LLM 交流,认为现代模型已具备从零散、不完整的输入中理解用户意图的能力。这一观点挑战了「提示词工程」的必要性,降低了普通用户使用 AI 的门槛。
Andrej Karpathy’s trick for getting better answers from AI: Just ramble at it for 10 minutes - AOL
72Andrej Karpathy 建议用户放弃精心设计提示词,转而用语音模式对 LLM 进行长达10分钟的自由漫谈,让 AI 从混乱的思绪中提炼关键信息。他认为这种方式能更好地划分人机分工:人负责倾倒原始想法,AI 负责重构和整理。此方法契合当前 AI 语音交互工具快速发展的趋势。
Andrej Karpathy’s trick for getting better answers from AI: Just ramble at it for 10 minutes – DNYUZ
72Andrej Karpathy 提倡用「乱说10分钟」代替精心设计的提示词,通过语音模式向LLM进行意识流式倾诉,让AI从混乱输入中提取关键信息。他认为这种方式能更好地分配人机协作中的角色——人负责输出原始想法,AI负责整理重构,最终减少后续纠错成本。
Andrej Karpathy 提出「长篇语音提示」方法:对复杂任务先对着AI连续说10分钟,无需整理思路,让模型自行提取核心意图。他认为大模型擅长从碎片化输入中重建真实需求,必要时可让模型反向提问,形成迷你访谈式交互。这种方法的核心价值在于降低提示词构建门槛,同时通过对话倒逼用户澄清自身思维。
Karpathy 分享了一种名为「长篇口述提示」的技巧:面对复杂任务时,对着语音输入随意讲话约10分钟,内容无需整理。他认为大模型能从碎片化信息中重建真实意图,有时还可让模型反问以澄清思路,从而减少后续纠错成本。
本期视频介绍了多款最新AI工具发布:一款拥有独立电话号码和邮箱、能代替用户打电话发邮件的AI助手(类Jarvis);一款可通过Claude Code等AI编程的消费级机器人(售价$4199);以及一款支持语音指令直接驱动AI编程Agent的工具。整体聚焦于AI Agent从虚拟走向实体、从文字交互走向语音/行动的趋势。
作者作为非技术人员,通过Vibe Coding(用自然语言描述需求让AI生成代码)成功训练了自定义语音唤醒词,实现了此前因技术门槛而放弃的项目。文章以亲身经历探讨Vibe Coding如何降低软件开发门槛,同时理解专业开发者对此现象的担忧,并将其类比于数字音乐工具对音乐行业的冲击。
Claude 为移动端发布了新的语音模式,支持 Sonnet 和 Opus 模型,并升级为具备执行操作能力的完整 Agent。作者将其类比为「语音版 Claude Code」,强调连接配置简便易用。
Riley Brown 展示了如何用 Cursor(AI 编程工具)和 OpenAI GPT Realtime 2 语音模型,通过三条提示词零代码构建一个类 Jarvis 的个人语音 AI 助手,支持语音交互、计算机控制和图像生成。内容以实操教程为主,强调无编程基础也可完成。
本期节目涵盖AI行业多个热点:Karpathy加入Anthropic预训练团队、AI在网络安全攻击中的能力提升、企业借AI重组裁员(ClickUp裁员22%)、Anthropic游说反对开源AI,以及Claude成功协助找回比特币钱包等事件。内容横跨人才动态、安全风险、组织变革与开源生态多个维度。节目整体以行业评论视角呈现,信息密度较高但深度有限。
本视频介绍了Claude Fable 5(即Claude的最新代号更新)在'氛围编程'(vibe coding)场景下的能力,演示了如何用自然语言提示词直接构建AI播客生成器,并结合Fish Audio S2.1 Pro语音合成API实现端到端自动化。作者认为Fable 5是目前最适合AI代理和应用构建的模型,性价比优于Opus 4。
ChatGPT 新语音模型体验大幅提升,交互更自然拟人,支持长时间倾听且不随意打断用户。作者作为创业者将其用于头脑风暴场景,认为与上一代模型有质的差距。整体属于早期用户的产品体验分享。