← 回首页

做 AI 产品,轮不到拼技术

真人长视频 · EP0091 2026年9月2日 02:45
这一期讲什么

企业 AI 落地、做 AI 产品这件事情,比的是洞察和解决方案,很多时候根本轮不到去拼技术能力。就拿语音输入法来举例——很多大厂的产品不是技术不行,但是非常的难用。这不是我在黑谁,是我自己做过语音输入之后,拆出来的真实感受。

三个让用户骂街的体验问题,每一个的根因都不是「模型不够强」,每一个的解法也都不需要更强的技术。卡住的地方,是有没有想明白。

企业 AI 落地、做 AI 产品这件事情,比的是洞察和解决方案,很多时候根本轮不到去拼技术能力。就拿语音输入法来举例——很多大厂的产品不是技术不行,但是非常的难用。我自己做过这个东西,踩过坑,拆下来发现:让产品难用的那几个问题,没有一个是技术解决不了的,但也没有一个是靠更强的技术去解决的。

先说第一个。我们用快捷键开启语音输入,觉得按键和说话是同时发生的,但实际上手有的时候是比嘴慢的,而且语音识别建立连接也是需要时间的。这就造成了我们说的前两个字很容易就被识别不到、被丢掉了。你一句话开头没了,后面再准也白搭,用户的感受就是「这玩意儿不行」。但这是为什么呢?模型识别能力不够吗?不是。它压根就没听到那两个字。这就不光是一个技术问题,这是一个洞察问题。解法也很简单:让输入法一直在听你说话,当我们按键的时候,把按键之前讲话的内容也一并进行处理,就解决了。不需要换模型,不需要提升算力,需要的是你意识到「手比嘴慢」这件事。

第二个痛点更普遍。很多输入法是我们说完了之后才进行识别的,等候的时间很长。这是为什么呢?这通常是想要提升识别的准确率。音频识别的模型分为两种——整体识别是把整句话完整地进行识别和回传,可以用提示词、用热词去修正它的准确率;流式识别是一个字一个字识别的,虽然准确率也不错,但是多少也会出现问题。大部分产品选了整体识别,图的是准,代价是用户说完之后干等着,不知道自己的话有没有被收到。解决方案也非常简单,也不是通过很强的技术去做的:先用流式识别,让一个字一个字地被显示出来,让人能够看到「我已经输入成功了」;虽然还有很多错误的地方,但在我完成输入的同时,会把整段内容用整体识别的方式重新修订一下——整个过程大概半秒到一秒,人其实是感觉不到的,但这个用户体验就会提升很多。两种模型都是现成的,谁都能调,区别只在于你有没有想到把它们串起来用。

第三个问题是从第二个里衍生出来的。整体识别可以注入热词来修正同音字、人名、专有名词,但这些词从哪来?传统的方式是提供一个热词的个人词库,但是正常的用户不会自己去管理这个词库。通常都是 AI 自动识别并且添加可能的热词,但是这个热词词库一旦超出了一个量级——比如说超过了 100 个词——那噪音就会比它修复的效果要多了,效果反而会越来越差。词库越大,干扰越多,这不是模型的问题,是词库管理的问题。解法也不是去迭代模型,而是让这个热词的词库是动态变化的——根据这个输入法所在的环境、它的上下文。比如说我们是在一个智能体的软件里面,它所在的项目记忆当中,可能会挑出当前最适合当前环境的一个热词库进行注入,这个项目之前提及的所有的人名、专业名词都在里面。这样就可以让它的效果变得非常好。还是那句话,不是模型变强了,是你把对的词在对的时候喂给了它。

三个问题讲完,回头看一下:没有一个解法需要你去训练一个更强的语音模型,没有一个需要你砸更多算力。每一个卡点,卡的都是「有没有想明白用户到底在哪里难受」。技术是一样的技术,大厂能调的 API 你也能调,但产品好不好用,取决于你有没有那个洞察。

所以我经常说的就是,做一个好用的 AI 产品,根本还不到比技术的阶段。顶尖的技术是靠天才和资源去突破的,而顶尖的洞察和解决方案,是我们自己也可以去锻炼的一种能力。

顶尖的技术是靠天才和资源去突破的,而顶尖的洞察和解决方案,是我们自己也可以去锻炼的一种能力。