做 AI 产品,轮不到拼技术
企业 AI 落地、做 AI 产品这件事情,比的是洞察和解决方案,很多时候根本轮不到去拼技术能力。就拿语音输入法来举例——很多大厂的产品不是技术不行,但是非常的难用。这不是我在黑谁,是我自己做过语音输入之后,拆出来的真实感受。
三个让用户骂街的体验问题,每一个的根因都不是「模型不够强」,每一个的解法也都不需要更强的技术。卡住的地方,是有没有想明白。
企业 AI 落地、做 AI 产品这件事情,比的是洞察和解决方案,很多时候根本轮不到去拼技术能力。就拿语音输入法来举例——很多大厂的产品不是技术不行,但是非常的难用。我自己做过这个东西,踩过坑,拆下来发现:让产品难用的那几个问题,没有一个是技术解决不了的,但也没有一个是靠更强的技术去解决的。
先说第一个。我们用快捷键开启语音输入,觉得按键和说话是同时发生的,但实际上手有的时候是比嘴慢的,而且语音识别建立连接也是需要时间的。这就造成了我们说的前两个字很容易就被识别不到、被丢掉了。你一句话开头没了,后面再准也白搭,用户的感受就是「这玩意儿不行」。但这是为什么呢?模型识别能力不够吗?不是。它压根就没听到那两个字。这就不光是一个技术问题,这是一个洞察问题。解法也很简单:让输入法一直在听你说话,当我们按键的时候,把按键之前讲话的内容也一并进行处理,就解决了。不需要换模型,不需要提升算力,需要的是你意识到「手比嘴慢」这件事。
第二个痛点更普遍。很多输入法是我们说完了之后才进行识别的,等候的时间很长。这是为什么呢?这通常是想要提升识别的准确率。音频识别的模型分为两种——整体识别是把整句话完整地进行识别和回传,可以用提示词、用热词去修正它的准确率;流式识别是一个字一个字识别的,虽然准确率也不错,但是多少也会出现问题。大部分产品选了整体识别,图的是准,代价是用户说完之后干等着,不知道自己的话有没有被收到。解决方案也非常简单,也不是通过很强的技术去做的:先用流式识别,让一个字一个字地被显示出来,让人能够看到「我已经输入成功了」;虽然还有很多错误的地方,但在我完成输入的同时,会把整段内容用整体识别的方式重新修订一下——整个过程大概半秒到一秒,人其实是感觉不到的,但这个用户体验就会提升很多。两种模型都是现成的,谁都能调,区别只在于你有没有想到把它们串起来用。
第三个问题是从第二个里衍生出来的。整体识别可以注入热词来修正同音字、人名、专有名词,但这些词从哪来?传统的方式是提供一个热词的个人词库,但是正常的用户不会自己去管理这个词库。通常都是 AI 自动识别并且添加可能的热词,但是这个热词词库一旦超出了一个量级——比如说超过了 100 个词——那噪音就会比它修复的效果要多了,效果反而会越来越差。词库越大,干扰越多,这不是模型的问题,是词库管理的问题。解法也不是去迭代模型,而是让这个热词的词库是动态变化的——根据这个输入法所在的环境、它的上下文。比如说我们是在一个智能体的软件里面,它所在的项目记忆当中,可能会挑出当前最适合当前环境的一个热词库进行注入,这个项目之前提及的所有的人名、专业名词都在里面。这样就可以让它的效果变得非常好。还是那句话,不是模型变强了,是你把对的词在对的时候喂给了它。
三个问题讲完,回头看一下:没有一个解法需要你去训练一个更强的语音模型,没有一个需要你砸更多算力。每一个卡点,卡的都是「有没有想明白用户到底在哪里难受」。技术是一样的技术,大厂能调的 API 你也能调,但产品好不好用,取决于你有没有那个洞察。
所以我经常说的就是,做一个好用的 AI 产品,根本还不到比技术的阶段。顶尖的技术是靠天才和资源去突破的,而顶尖的洞察和解决方案,是我们自己也可以去锻炼的一种能力。
来源:EP0091(2026-09-03, 2:45) · 音频=本人真录 · 画面=数字人(AI 生成) · 文本与时间码均由 gemini-2.5-pro 对这条录音逐段 ASR 得出; 三处经跨模型窄窗口定点复听核实(0-2.4s 开场首字「写」/ 79.5-87s 段边界补回被吞的「多」/ 115.2-118.6s 去掉 ASR 重复的「一一个」) 两处经跨模型定点复听核实(11-17s「我们去学别人做一个 skill」/ 48.5-54s「源代码」), 另有「把需求告诉它」「它就可以」两处按指物代词做同音规范化
[00:00] 企业 AI 落地做 AI 产品这件事情 比的是洞察和解决方案 很多时候根本轮不到去 拼技术能力 就拿语音输入法这件事 情来举个例子 很多大厂的产品不是技术不行 但是非常的难用 比如说我们用快捷键来 开启语音输入 我们觉得按键和说话是 同时发生的 但实际上手有的时候是比嘴慢的 而且语音识别建立连接也是 需要时间的
[00:25] 这就造成了我们说的前两个字 很容易就被识别不到被丢掉了 这就不光是一个技术问题 这是一个洞察问题 解法也很简单 就是让输入法一直在听你说话 当我们按键的时候呢 把按键之前讲话内容也 一并进行处理就解决了 还有一个非常典型的痛点 就是很多输入法是 我们说完了之后 才进行识别的 等候的时间很长 这是为什么呢? 这通常是想要提升识别的准确率
[00:52] 因为音频识别的 模型分为两种 一种是整体识别 一种是流式识别 整体识别的模型呢是 把整句话完整地 进行识别和回传 是可以用提示词 用热词去修正它的准确率的 而流式识别的模型是 一个字一个字识别的 虽然准确率也不错 但是多少也会出现问题 解决方案呢也非常简单 也不是通过很强的 技术去做的 就是先用流式识别
[01:17] 让一个字一个字的 被显示出来 让人能够看到说 我已经输入成功了 说出来这么多 话了虽然它还是 有很多错误的地方 但是在我完成输入的同时 会把整段内容用整体识别的 方式重新修订一下 整个过程大概半秒到一秒 人其实是感觉不到的 但是这个用户体验就会提升很多 这个过程呢又衍生了新的问题 也就是很多同音字 人名或者是专有名词
[01:43] 它不可能是完全准确识别的 传统的方式呢是 提供一个热词的 这个个人词库 但是正常的 用户不会自己去管理这个词库的 通常都是 AI 自动识别并且添加 可能的热词 但是这个热词词库一旦 超出了一个量级啊 比如说超过了 100 个词 那噪音就会比它修复的 效果要多了 效果反而会越来越差 那这个的解决方案呢 也不是去迭代模型 而是让这个热词的词库是
[02:09] 动态变化的 根据这个输入法所在的 环境它的上下文 比如说我们是 在一个智能体的软件里面 它所在的 项目记忆当中可能会挑出 当前最适合当前环境的 一个热词库进行注入 对吧这个项目 之前提及的所有的人名啊 专业名词啊 这样就可以让它的 效果变得非常好 所以我经常说的就是 做一个好用的 AI 产品 根本还不到比技术的阶段
[02:34] 顶尖的技术是 靠天才和资源去突破的 而顶尖的洞察和解决方案 是我们自己也可以去锻炼的 一种能力 那今天的内容就是 这样我们明天再见拜拜