不必垂直行业,要垂直能力模块——十几分钟做出的聋哑人沟通工具
起因是前段时间在杭州带线下课,有个学生非常敏锐地抓到了一个需求:聋哑人跟普通人面对面沟通,现有工具几乎帮不上忙。语音识别准确率低是一方面,更致命的是——就算对方说的话被识别出来了,聋哑人也很难在对话节奏里靠打字完成回复。这不是「翻译」的问题,是整个交互流程断掉了。
我复用之前开发语音输入法的那套技术框架,在课堂上大概十几分钟就把网站做出来了。这件事让我重新想了一个老问题:做企业服务技术开发,真的必须垂直一个行业吗?
科技向善从来不只是一句口号。在腾讯工作了很多年,到现在还是很喜欢那套企业文化——给员工的自由度很高,真的投入了大量资源去做公益。最近发起了一个公益项目,帮助聋哑人群体,叫「传声」。
起因是前段时间在杭州带线下课,有个学生非常敏锐地抓到了一个需求:聋哑人跟普通人面对面沟通,现有工具几乎帮不上忙。语音识别准确率低是一方面,更致命的是——就算对方说的话被识别出来了,聋哑人也很难在对话节奏里靠打字完成回复。这不是「翻译」的问题,是整个交互流程断掉了。
我们当时想到的方案是这样的:一边精准识别对方说的话,实时转成文字给聋哑人看,一边根据对话内容自动生成几条不同可能的回复,点一下就能用 TTS 发声。系统还存了常用短语——「谢谢」「对不起」「麻烦你再说一遍」——点一下就出声。整个设计的核心是让聋哑人不用打字就能完成一次完整的面对面对话。
我复用之前开发语音输入法的那套技术框架,在课堂上大概十几分钟就把网站做出来了。目前已经上线,小规模在试用,全部算力成本暂时由我自己支出,后续会去尝试联系公益基金,想把它做成长期持续的。
这件事让我重新想了一个老问题:做企业服务技术开发,真的必须垂直一个行业吗?
行业里通常的说法是,你得扎在一个垂直行业里,把框架、产品、交付流程都磨透,这样复用率才高。道理没错。但我个人兴趣太广,接了很多跨行业的项目,走的是另一条路——不是垂直行业,而是垂直能力模块。在跨行业项目的开发过程中,我在图片生成、音频识别这些具体的技术模块上攒下了很深的积累。这些模块本身是不挑行业的。
就拿音频识别这一个模块来说:出版行业可以用来采集记录采访稿,直播可以用来做切片,短视频可以用来加准确的字幕,这个公益项目可以用来很快做出高品质的 MVP。一个模块,四个完全不同的行业,都跑得通。
结论其实很直接:不必非得集中在一个行业做研究,只要在一个能力模块上做到 90 分以上,就可以快速跨行业、跨项目复用。垂直行业是一种路径,垂直能力模块也是一种路径,后者对兴趣广泛、项目多样的人来说可能更现实。
「传声」这个项目对我来说就是一个活的证据——不是从零开始做一个公益产品,而是把一个已经打磨到位的技术模块,十几分钟接到一个新场景里,就能真的帮到人。科技向善不需要另起炉灶,它可以是你日常能力积累的自然延伸。
来源:EP0084(2026-08-24, 2:44) · 音频=本人真录 · 画面=数字人(AI 生成) · 文本与时间码均由 gemini-2.5-pro 对这条录音逐段 ASR 得出并经三处跨模型定点复听订正
[00:00] 科技向善从来不只是一句口号 AI 公益这件事情有很多时候 其实大企业就是 顺手就做了的事情 在腾讯工作了很多年嘛 还是非常喜欢腾讯的企业文化 首先给员工的自由度很高啊 我做了很多的学习和探索 其次就是腾讯真的投入了 很多资源去做公益 最近我也发起了 一个公益项目啊 是帮助这个聋哑人群体的 起因是前段时间在杭州带线下课
[00:26] 有个学生非常敏锐地 发现到了一个需求 就是聋哑人跟正常人沟通 是非常不方便的 现有的语音识别工具呢 准确率是比较低的 而且就算识别出来了 对方说的内容 聋哑人呢也很难短时间内 通过打字的方式进行回复 所以当时我们就想到了 一个创意啊是什么呢 就是利用我之前开发 语音输入法的 那一套技术框架 去精准地识别普通人说的那句话
[00:52] 给聋哑人看同时去 判断这个说话的内容 自动去生成几条不同 可能性的回复 这样聋哑人通过点击选项 就能够快速的进行回复 甚至可以用这个这个 TTS 的技术去进行发声 同时呢这个系统也会保存很多 常用的这种对话的用词 聋哑人只需要点击就 能够发出声音 进行语音的回复 比如说谢谢啊对不起啊
[01:18] 麻烦你再说一遍啊这样的 一些简单的话 这个方便了聋哑人 跟普通人之间的交流 那我在课堂上大概用了十几分钟 就把这个网站做出来了 这不禁引发了我的一个思考 之前我们说这种做这种 企业服务技术开发 最好去垂直一个行业对吧 以至于我开发出来的 这种框架技术 可以被甚至产品级都是被复用的 但是因为我个人的
[01:43] 兴趣实在是太广泛了 加上我喜欢做不同的事情 所以我接了很多跨行业的项目 我发现在这些 项目的开发当中呢 我会在一些垂直的 技术模块上 有非常深的技术积累 比如说图片的生成对吧 比如说音频的识别 这些功能是 可以跨行业快速复用的 就拿这个音频识别 这件事情来说吧 那出版行业可以用它来 去采集记录采访稿
[02:08] 直播可以用它来做切片 那短视频可以用它来加 准确的字幕 甚至这个公益项目 又可以非常快速的去 完成一个高品质的 MVP 的开发和上线 其实 并不一定 集中在一个行业去做研究 只是在一个能力模块上 我们做到了 90 分以上 就可以快速的跨行业 跨项目的进行复用了 这个公益项目其实已经上线了 目前小规模的在试用
[02:33] 全部的算力成本呢 暂时是由我来支出的 那后续也会去尝试联系公益基金 把它做成一个长期持续的 可以真的 帮助到聋哑朋友们的 一个好帮手