Faster-whisper距离我上次分享已经过去挺长时间了,而且中间也更新了多次了,看到Faster-whisper昨天刚更新了一下,更新内容有模型更新和处理速度大幅提升,更新内容还是挺重要的,我就做了一个最新版本的一键启动包,同时我对整合包功能也做了些修改和优化。

Faster-whisper语音转录工具介绍
faster-whisper是使用CTranslate2对 OpenAI 的 Whisper 模型的重新实现,是 Whisper 的一个优化版本,它是 Transformer 模型的快速推理引擎,用于实现语音识别。此实现比openai/whisper快 4 倍,且精度相同,同时占用的内存更少。在 CPU 和 GPU 上采用 8 位量化,效率可进一步提高。
主要功能
- 语音转录:
- 将语音文件(如 MP3、WAV)转换为文本。
- 支持多语言语音转录。
- 语言检测:
- 自动检测输入音频的语言,无需手动指定语言。
- 分段处理:
- 能够将长音频分成多个片段进行处理,从而提升处理效率和内存利用率。
Faster-whisper特点
- 高效优化:
- 使用 CTranslate2 后端来加速模型推理,显著提升了运行速度。
- 支持 GPU 和 CPU 加速,充分利用硬件资源。
- 轻量化:
- 更小的模型大小和更低的资源需求,适合嵌入式设备或低性能机器。
- 灵活性:
- 允许用户选择不同的模型大小(tiny、base、small、medium、large)以平衡速度和精度。
- 多语言支持:
- 支持 Whisper 所有的多语言模型,适用于不同语言的转录需求。
Faster-whisper更新说明
Faster-whisper最近发布的版本更新内容有如下方面:
1.1.1更新内容
恢复原始 VAD 参数命名
使批量 suppress_tokens 行为与顺序相同
修复 OOM 错误 – VAD 的 RAM 使用率过高
将音频持续时间和 VAD 移除持续时间添加到 BatchedInferencePipeline
修复 neg_threshold
1.1.0新功能
- 新的分批推理速度提高了 4 倍,而且准确度也提高了
- 支持新
large-v3-turbo
模型。 - VAD 过滤器现在在 CPU 上的运行速度提高了 3 倍。
- 特征提取速度现在提高了 3 倍。
- 已添加
log_progress
到WhisperModel.transcribe
打印转录进度。 - 添加了
multilingual
转录选项,允许转录多语言音频。请注意,大型模型已经具有代码转换功能,因此这对medium
模型或较小的模型最有益。 WhisperModel.detect_language
现在可以选择使用 VAD 过滤器,并改进使用language_detection_segments
和的语言检测language_detection_threshold
。
问题修复
chunk_length
在<30 秒时使用正确的特征填充编码器输入seek
在输出中使用正确的值
其他变化
- 在 Word、Segment、TranscriptionOptions、TranscriptionInfo 和 VadOptions 中用 dataclass 替换 NamedTuple,这样就可以转换为 json 而无需嵌套。
- 为开发添加了新测试
- 在自述文件中更新了基准
- 在基准中使用 jiwer 而不是评估
- 过滤掉抑制标记中的非语音标记
Faster-whisper整合包使用说明
首先将网盘内的压缩包下载到电脑解压出来,然后运行【启动软件.exe】。软件支持处理mp3,wav,mp4格式音视频。也支持批量处理。可以将需要处理的音视频文件或文件夹鼠标左键按住拖动到软件窗口中。软件会自动识别路径并填充文本编辑框。
选择模型:发音标准,音频干净清晰的话,使用small模型基本就够用了,如果你的音频文件比较复杂可以使用更大的模型,模型越大识别越精准,但是对电脑配置要求也越高。软件包只打包了small模型,如果选择更高模型的话,软件会自动下载模型。模型下载源为国内站点,速度可达四五十兆每秒,速度非常快,如果你下载速度比较慢的话,可以关闭软件重新打开,重新运行下载。
batch size:就是批处理大小,值越大,处理速度越快,但是对电脑配置要求也越高。默认值为4,相对较小。可以根据你电脑显存使用情况适当调高该值。
计算精度:默认float16,int8速度更快,显存消耗也会更少。
翻译工具:国外用户用Google,国内用户用百度,百度翻译api申请教程《最新百度翻译api免费申请AppId和AppSecret流程,每月免费100万字符》
翻译目标语言:想把识别出的文本翻译成什么语言的文本
点击【开始处理】按钮后软件就会开始处理选定的内容,识别结果保存在项目文件夹内的outputs文件夹内。
整合包更新内容:
相对于我分享的上个整合包,本次分享的整合包版本有了多处升级。
1、新增批量处理功能,直接选择文件夹,软件就会处理文件夹内的所有音视频文件。仅是MP4格式视频和音频类型文件,不要有其它类型文件。
2、新增batch size和计算精度选项,对高配电脑更加友好,处理效率更高
3、优化字幕生成算法,启用字级时间戳,生成的字幕更准确更友好。
4、增加对最新模型large-v3-turbo模型的支持
5、其它细节上的一些优化。
注意事项
整合包只支持Windows 10或11
软件运行路径中不要有非英文字符和空格
使用前请先将英伟达显卡驱动更新到最新版本,否则可能会报错
理论支持CPU模式,支持没有英伟达显卡的电脑使用,但是未做测试,有需要的可自行测试。
语音发音不标准、音频不干净等原因可能会导致输出繁体中文,可尝试更换更大的模型
如果选择处理文件夹,文件夹内不要有音频、MP4视频以外的文件类型
语音识别转文字软件faster-whisper一键启动包下载链接
相关推荐
最近更新

支付宝发现金红包了!支付宝的羊毛快来薅💰️💰️
支付宝小荷包搞活动啦,新用户加入立得2元无门槛现金红包。 支付宝小荷包是支付宝推出的一款便捷的零钱管理工具,适合日常小额支付和理财。 什么是支付宝小荷包? 支付宝小荷包,简单来说,就像是你在支付宝里的“私人金库”。它不仅支持快速转账、收款,...

美团官方发福利,吃喝玩乐外卖神券天天领
美团官方发福利了,加美团企业微信,每天免费领各种吃喝玩乐神券,领取福利流程如下: 1、微信扫码登录↓↓↓ 2、长按添加美团企业微信 3、天天领券 每日签到领取更多红包 更有超多促销活动,限时活动,低价爆品等,让你放肆嗨吃嗨喝!

免费PDF文档翻译软件BabelDOC整合包下载,AI一键PDF全文翻译工具
分享另一个热门的PDF文档翻译软件BabelDOC,软件可以将PDF文档由原语言翻译成指定语言文档,基于在线大语言模型处理能力,文档翻译效果更准确,并保留排版,支持批量文档翻译,我制作了最新版免安装一键启动整合包。 BabelDOC介绍 另...

AI歌曲创作软件YuE整合包下载,一键谱曲演唱音乐生成器
YuE:开放的全曲音乐生成基础模型,可免费一键生成完整歌曲,AI作曲,AI演唱,是一个高质量的AI音乐生成软件。我制作了最新的面安装一键启动整合包。 YuE介绍 YuE 是一系列突破性的开源基础模型,专为音乐生成而设计,尤其适用于将歌词转化...

可灵AI会员专属优惠邀请码,限时福利领取
可灵AI发福利了,通过专属优惠邀请码 6BZPEJK83JZ9 可额外获得50%灵感值。 现在图片、音乐、视频等等,啥都可以用AI生成,可灵AI就是快手旗下非常强大的一个AI内容创作平台,功能多样,效果强大。我最近半年几乎每周都会使用多次,...

多人对话语音合成软件CSM整合包,AI多人文字转语音工具
CSM是发布不久的一款多人对话语音生成模型,声音自然延迟低,同时支持克隆音色语音合成,我基于当前最新版本制作了免安装一键启动整合包。 Sesame CSM介绍 CSM(Conversational Speech Model) 是由...

AI自动化任务执行工具OpenManus一键启动整合包
OpenManus是另一款AI自动化任务执行软件,是Manus的开源实现,无需邀请码,本地运行,我基于当前最新版本制作了免安装一键启动整合包。 OpenManus介绍 OpenManus 是一个开源复刻版 AI 智能体框架,由 MetaGP...

CAMEL-AI开源多智能体协作框架OWL一键整合包,自动化任务助手
OWL 是由 CAMEL-AI 团队开发的开源多智能体协作框架,旨在通过动态智能体交互实现复杂任务的自动化处理,在 GAIA 基准测试中以 69.09 分位列开源框架榜首,被誉为“Manus 的开源平替”。我基于当前最新...

微软PDF/WORD/HTML文档转Markdown格式软件markitdown整合包下载
本次和大家分享另一个微软发布的非常热门的文件文档转Markdown格式文档的软件markitdown,软件可以将PDF,word,ppt,Excel等十几种格式文档转换为markdown格式文档,我基于当前最新0.1.2版本制作了免安装一键...

AI描述万物软件describe-anything整合包,精准描述图片视频中指定区域内容
本次和大家分享一个英伟达联合其他大学开发的一款应用describe-anything,该应用可以通过AI识别分析并详细描述图片视频中指定区域物体内容,我基于最新版制作了免安装一键启动整合包。 describe-anything介绍 Desc...