AI/大模型中
← 贴纸墙
JOURNEY · DETAIL
闪电说:三次转型踩坑后押中语音输入
创办:余猛、龚震 · 闪电说(探未实验室)
JOURNEY
关键字段
FIELD STAMPSINDUSTRY 行业AI/大模型
REGION 地区中
SCALE 规模小企
CHANNEL 渠道线上
起步缘由
2023 年 ChatGPT 爆发后,创始人余猛思考大模型时代真正的差异化只剩数据——计算是通用的,模型结构能参与创新的全球可能就一百来人。团队由此确定做「以数据为核心的记忆工具」,并给自己立规:收敛到一个大方向,从 2024 年 1 月起只做和声音相关的事。
发家里程碑
2023年
第一次尝试:对话式记忆助手 失败
用 AI 当界面的手机记忆工具(记 To-do、记大姨妈、记生日)。败因:GPT-4 单人月成本 10 美金(免费 APP 无法对标);记东西反人性、频次太低。
2023年
第二次尝试:全天候录音 失败
产品形态从电脑客户端+录音笔 → 手机 APP → 耳夹耳机 → 装 APP 用任何耳机变记录设备。败因:拿到全天候声音后 AI 无法利用——打呼噜要专门 AI、咳嗽要医疗能力、情绪识别又是另一套,是生态问题,团队跨不过,这一阶段从2023年延续到2024年。
2025年
转折点:发现语音编程刚需 拐点
Claude Code 发布后余猛和团队从早用到晚,发现「语音编程太爽了」——这是真实、高频、有付费意愿的场景,直接决定从记忆转向语音输入。
2025年
产品定型:闪电说语音输入法 PMF
端侧优先(本地语音模型毫秒级识别),短按直接说/长按帮我说,结合屏幕上下文与知识库把话说好;AI 纠错开关开启率约 50%,用 API key 的不到 20%,前 3%-5% 付费用户覆盖全部成本,毛利率约 70%。
2025年
商业化与出海 增长
定位「免费的 Wispr Flow」,在 Wispr Flow 花几千万美金教育过的市场打免费牌;走 100 个小 KOL + SEO/GEO + 投放的常规增长路线;按 token 分销逻辑商业化,出海优先 T0 国家(美国付费率 5%-7% vs 中国 1%-2%),这一阶段从2025年延续到2026年。
转折点
- 2025 初从记忆转向语音输入——Claude Code 让他们亲身体验到语音编程的刚需强度
- 从「主动记录」转向「被动输入」——记东西反人性,但说话是人的本能
- 把产品重心从「记忆工具」转向「语音输入」,等于放弃已投入的方向,转而去解决用户更本能的动作。
失败与踩坑
- 对话式记忆助手:成本高(GPT-4 10 美金/月/人)+ 频次低(反人性)
- 全天候录音:拿到数据但 AI 生态无法利用,生态鸿沟非团队能力可跨
- (认知层)大厂经历不构成创业能力——在大厂是机器的一部分,学不会怎么挣第一个 100 万
关键成功要素
- 找到长期方向并暴力破解:2024.1 至今只做声音相关,每天复利
- 把 AI 应用当消费品卖:「卖奶茶」逻辑,采购大模型技术 + 场景独特判断 + 包装好卖出去
- 增长无奇技淫巧:100 个小 KOL 每个几百几千(爆一条回本)+ SEO/GEO + 找专家外包学会自己做
- 商业化赚有钱人的钱:前 3%-5% 付费 + 70% 毛利覆盖 100% 用户成本
- 出海优先 T0 国家:美国付费率 5%-7% 且客单价高,中文用 SenseVoice 开源方案省成本
经验教训
- 技术壁垒的真相:有一天竞争壁垒就是你活过来了,谁走到最后回头一看那些才是壁垒
- 创新没有方法论:所有方法论都要被质疑,重要的是新的思想和方法
- idea 来源:多看 GitHub 日榜高赞项目(背后是明确需求)+ 微信指数验证搜索热度
- 中国用户不是付费习惯差而是经济水平差异;送实物(麦克风)比返现(200 元)转化更好
- 创业给自己足够长时间:没有任何人出来创业一年就有成果,找到方向后剩下的是耐心
核心数据
- 智能纠错上线时间:50%(公开资料口径,未验独立复核)
- 接口密钥用量:<20%(公开资料口径,未验独立复核)
- 付费意向未转化数:30%(公开资料口径,未验独立复核)
- 毛利率:70%(公开资料口径,未验独立复核)
- 中国大陆付费用户数:1%-2%(公开资料口径,未验独立复核)
- 台湾付费用户数:3%-5%(公开资料口径,未验独立复核)
- 美国付费用户数:5%-7%(公开资料口径,未验独立复核)
- 方言模型训练成本:约 200 万/个(大头在数据)(公开资料口径,未验独立复核)
- 主要语种准确率:90% 上下(公开资料口径,未验独立复核)
竞争对手 / 同行
闪电说在语音输入与记录工具赛道的主要对手包括Wispr Flow、SenseVoice与Monica:Wispr Flow以免费策略抢占个人用户,SenseVoice依托开源方案把中文识别做到九十多种方言覆盖,Monica则靠移动端功能差异在海外获得订阅收入。闪电说的差异化在于把语音输入与本地记忆结构绑定,用「以数据为核心」的定位避开纯识别能力的正面价格战(公开资料口径,未验独立复核)。