行业资讯

TMSpeech 完全入门指南:免费离线语音转文字,三步让电脑实时出字幕

发布时间:2026/8/27 14:33:32
TMSpeech 完全入门指南:免费离线语音转文字,三步让电脑实时出字幕 TMSpeech 完全入门指南免费离线语音转文字三步让电脑实时出字幕【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech同事问你刚才定的是什么你的笔还停在上一页笔记——这种开会、上录播课时漏掉关键一句的尴尬谁都有过。如果电脑能把听到的声音实时转成字幕这个问题基本就不存在了。TMSpeech就是这么一个工具免费、开源、全程离线的语音转文字工具Windows 上一运行就持续把电脑正在播放的声音转成屏幕上的滚动字幕识别全部在本地完成不注册账号、不联网、不弹广告。快速上手下载、装模型、按开始 第一步下载并运行。从项目 Release 页面下载最新版本解压后双击TMSpeech.exe即可没有任何安装流程。想直接看源码的话仓库可以这样克隆git clone https://gitcode.com/gh_mirrors/tm/TMSpeech第二步安装语言模型。语音识别离不开语言模型。打开设置窗口在左侧导航找到「资源」页这里列出了所有可安装的资源点「中文模型」右侧的安装按钮进度条走完状态就变成「已安装」。语言模型和识别器插件都在这一个页面统一管理。第三步开始识别。回到主界面点开始计时器开始跳动字幕窗口跟着声音实时滚动。每句结束的内容会自动归档到「我的文档」下的TMSpeechLogs文件夹按日期分门别类。它到底能干什么一张能力清单音频来源— 系统内录、麦克风、指定进程音频三种都能采 — 会议、网课、视频全覆盖而且电脑音量关掉照样识别识别方式— 本地流式识别声音进来边转边出结果 — 断网可用语音数据不出你这台机器资源占用— 普通笔记本实测CPU 占用不到 5%— 开着它继续干别的事机器不卡字幕展示— 无边框悬浮窗口可拖动、缩放还能锁定成鼠标穿透 — 像跟读歌词一样贴着声音走又不挡操作历史归档— 按日期自动保存到「我的文档/TMSpeechLogs」 — 会后全选复制纪要直接成型识别引擎与扩展— CPU 引擎、GPU 引擎、自定义命令三种可切换插件架构支持模型在线安装 — 换语言、换模型、接自己的程序都不用重装软件一句话区分同类工具云端识别是把声音寄出去翻译再寄回来TMSpeech 是翻译就坐在你本机免费 离线 低占用同时占齐。原理讲人话你电脑里的一条直播字幕流水线 把它想象成电视台的直播字幕系统信号进演播室字幕编辑员打字成品打在屏幕上。TMSpeech 就是这条流水线只是整套设备都装在本地。抓的是信号不是喇叭声。WASAPI 是 Windows 自带的音频接口TMSpeech 用它的环回捕获技术在控制台内部把音频信号截下来——声音根本不用经过扬声器所以你把系统音量拧到零它依然在认真听。音频源相关实现都在src/Plugins/TMSpeech.AudioSource.Windows/目录里麦克风、系统内录、进程音频各是一个独立插件。编辑员不等整句说完。流式识别的意思是音频一段一段送进来模型边听边写再靠句末检测判断哪里断句。于是上一句还没念完下一句的字幕已经滚上屏了这就是实时两个字的全部秘密。三位编辑员随意换。Sherpa-Onnx 走 CPU资源占用最低日常办公首选Sherpa-Ncnn 能调用 GPU 加速追求极限速度时上它命令行识别器则允许你接入任何自己认可的识别程序——把它的标准输出当字幕读单个换行更新当前句子双换行表示句子完成external_recognizer/目录里备好了现成的 Python 示例接 Whisper、SenseVoice 都很顺手。切换入口就在设置→「语音识别」页如图所示。核心接口定义在src/TMSpeech.Core/Plugins/下的 IAudioSource、IRecognizer 等文件里每个插件用一个tmmodule.json描述自己启动时自动扫描加载。用在哪网课、会议、保密场合网课一整节课的文字稿录播课、直播课都适用。把字幕窗口拖到屏幕下方老师讲的重点同步变文字手写跟不上也没关系课后打开TMSpeechLogs整节课的文字笔记已经整理好。外语课同理相当于白得一个随身字幕组。会议纪要不用手写了开会时让它跑着散会后打开历史记录全选、复制一份完整纪要到手。老板问进度、同事问刚才的结论瞟一眼就答得上来。保密场合声音不出门未公开的项目讨论、涉及机密的对话最怕的就是语音被传到云端服务器。TMSpeech 的识别全程在本地录了什么、聊了什么只有你和这台电脑知道这一条对很多团队来说比任何高级功能都值。进阶调优换外观、换引擎、接自己的识别程序 外观随心改字体大小、颜色、阴影、对齐方式都在「显示」页可调把窗口锁住后鼠标直接穿过去看视频时字幕完全不挡操作。所有配置项集中在src/TMSpeech.Core/ConfigTypes.cs中定义想摸清它的全部可调项可以从这里入手。托盘里收放程序常驻系统托盘开始/停止、锁定/解锁、退出都在右键菜单里开会更不用动鼠标。精度不够就换模型它基于 sherpa-onnx 框架并支持其流式模型下载一个更合适的模型后在设置中改一下模型路径即可。参与社区想要新功能提 issue懂 C#/Windows 开发直接提 PR——插件机制已经把扩展的路铺好了。大家最常问的几件事问题快速解法识别准确率一般确认选了匹配场景的语言模型安静环境效果更好也可换更大的流式模型在设置里改模型路径捕获不到系统声音把音频源选成系统内录个别系统需要在声音设置里启用立体声混音CPU 占用偏高切到 Sherpa-Onnx 引擎或换一个更轻量的模型找不到历史记录默认在「我的文档/TMSpeechLogs」保存路径可在设置中修改配置乱了想重置运行压缩包附带的重置配置脚本删掉现有配置后重新生成想接自己的识别程序设置中切到「命令行识别器」参考external_recognizer/下的示例脚本改造输出格式今天就可以开始先做这 4 件事从 Release 页面下载 TMSpeech解压双击运行在「资源」页装好中文语言模型点开始让字幕跟着网课或会议滚起来会后打开TMSpeechLogs拿走现成的文字纪要免费、离线、低占用、开源——装上它、装好模型然后放心走神让电脑替你记住一切。【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考