3 行代码转写一份会议录音transformers 语音识别快速上手指南【免费下载链接】transformers Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.项目地址: https://gitcode.com/GitHub_Trending/tra/transformers上一场会议的录音你还敢直接交给转写工具吗多人抢话、背景噪音转出来的文字错得一塌糊涂。transformers 是 Hugging Face 的模型定义框架覆盖文本、视觉、音频任务内置的自动语音识别能力让你用一行代码加载预训练模型直接拿到转写文本。读完这篇你能把 1 小时的会议录音转成文字整个过程不超过 5 分钟。 原理速览音频是怎么变成文字的语音识别的思路很直接音频先进入特征提取器转成模型能理解的频谱特征再由预训练模型逐段解码成文字。你不需要懂声学只要给对音频文件。仓库里 3 类常用架构按场景挑模型架构一句话说明Wav2Vec2CTC 解码轻量快速适合单人清晰语音的批量转写Whisper序列到序列架构对噪音和口音更稳适合会议、访谈录音SpeechEncoderDecoder音频编码器 文本解码器组合方便在特定任务上二次微调选好模型下面直接跑通第一个效果。⚡ 快速上手2 步转写出第一段文字环境准备只需两条命令git clone https://gitcode.com/GitHub_Trending/tra/transformers pip install transformers datasets soundfile librosa torchcodec最小可运行代码保存为asr_demo.pyfrom transformers import pipeline import soundfile as sf # 加载语音识别管道Whisper 对会议噪音更稳 asr pipeline(automatic-speech-recognition, modelopenai/whisper-large-v3) # 读入音频文件.wav / .flac 均可 audio, sampling_rate sf.read(meeting.wav) # 传入音频直接拿到转写文本 result asr(audio, sampling_ratesampling_rate) print(result[text])官方微调示例在 examples/pytorch/speech-recognition/里面有 CTC 和 seq2seq 两套完整脚本任务文档见 docs/source/en/tasks/asr.md。模型跑得通了效果到底怎么样看仓库里留存的真实记录。 效果验证仓库里的真实测试数据下面这组数据出自 examples/pytorch/speech-recognition/README.md是官方示例的微调与评测记录你可以直接对照复现模型数据集词错误率硬件训练耗时wav2vec2-baseTIMIT0.211 张 TITAN RTX32 分钟wav2vec2-large-lv60Librispeechclean100 小时0.0428 张 V1001 小时 30 分wav2vec2-large-xlsr-53Common Voice土耳其语0.311 张 V1001 小时 20 分wav2vec2-xls-r-300m多语言 Librispeech德语0.131 张 Titan 24GB15 小时 04 分两点观察小数据集上 wav2vec2-base 半小时就能出结果适合先跑通再放大想压错误率换更大的 lv60 或 xls-r-300m词错误率能从 0.31 降到 0.042 量级。数据看明白了跑的时候最容易在哪翻车 避坑与延伸3 个高频问题一句话解法预处理时程序卡死→ 多 worker 预处理会触发 OpenMP 线程冲突加环境变量再跑OMP_NUM_THREADS1 python run_speech_recognition_ctc.py ...官方示例里就标注了这个坑。中文录音识别质量差→ 换成多语言预训练模型Whisper 系列对中英混说场景更稳见 examples/pytorch/speech-recognition/run_speech_recognition_seq2seq.py 的 Whisper 微调流程。推理慢在 CPU 上→ 用 accelerate 自动检测加速器pipeline(..., deviceAccelerator().device)一行切换 GPU。想继续深入从 docs/source/en/tasks/asr.md 的微调教程入手或直接在 examples/pytorch/speech-recognition/ 里挑一个脚本改成你自己的数据跑完就是属于你自己的语音识别模型。【免费下载链接】transformers Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.项目地址: https://gitcode.com/GitHub_Trending/tra/transformers创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考