Whisper 三模型(base / small / medium)中文转写性能对比与选型实践
在实际语音转写项目中,模型选择往往直接决定了处理效率与文本质量的上限。本文基于一次真实中文视频转写实验,对 base、small、medium 三个模型在速度、准确率以及适用场景上的表现进行系统性分析,并给出工程层面的选型建议。
一、问题背景与核心结论¶
本次测试样本为一段 13 分 41 秒的中文时政口播视频,在统一硬件环境(RTX 4060 + CUDA + float16)下完成三模型转写。
从结果来看,三者表现呈现出典型的“性能-质量梯度”:
- 速度排序: base > small > medium
- 质量排序: medium ≳ small >> base
但需要强调的是:
medium 并非全面碾压 small,其优势主要集中在 高信息密度词汇(专名、地名、人名) 上,而 small 在绝大多数普通语句中已经接近最终可用水平。
结论可以压缩为三点:
- 快速初稿 → 用
base - 平衡效率与质量 → 用
small - 高质量底稿 → 用
medium
二、测试环境与执行条件¶
本次测试严格控制变量,确保对比有效:
- 视频时长:13:41
- 文件大小:98.64 MB
- 指定语言:
zh(关闭自动检测) - 推理设备:CUDA(float16)
- GPU:RTX 4060
- 执行方式:统一调用
transcribe_file()接口
所有模型均未触发 CPU fallback,保证结果可比。
三、性能表现:速度与规模¶
整体性能数据如下:
| 模型 | 耗时(秒) | 实时倍速 | 相对 base |
|---|---|---|---|
| base | 22.99 | 35.72x | 1.00x |
| small | 35.25 | 23.30x | 1.53x |
| medium | 74.21 | 11.07x | 3.23x |
可以明确几个关键事实:
第一,small 是明显的“性价比拐点”,仅比 base 慢 1.5 倍,却已经接近 medium 的质量。
第二,medium 的性能成本非常高,是 small 的 2.11 倍,属于典型“边际收益递减”。
第三,三者输出文本长度几乎一致(差异 <1%),说明:
模型差异不在“是否转写出来”,而在“是否转写正确”。
四、文本相似度分析¶
字符级相似度如下:
- base vs small:约 61%
- base vs medium:约 60%
- small vs medium:95.34%
这里需要避免误解:
base的低相似度并不等价于语义错误率 40%
主要原因包括:
- 繁体 vs 简体差异
- 同音字替换
- 分词与断句差异
但即便扣除这些因素,base 在关键实体识别上的错误仍明显更高。
五、质量差异的本质来源¶
1. 关键事实识别(时间 / 数字 / 术语)¶
base 在高权重信息点上错误更集中,例如:
- 年份错误(2016 → 2026)
- “通牒”识别失败
- 地名严重偏差
而 medium 在这些关键节点上基本稳定。
2. 常见语言模式(口语 / 固定搭配)¶
例如“买不了吃亏,买不了上当”:
base:语义破碎small:完整保留medium:完整 + 结构更清晰
说明:
small已经跨过“可读性门槛”,而base尚未。
3. 专有名词(核心差异点)¶
这是三模型真正拉开差距的地方:
| 类型 | base | small | medium |
|---|---|---|---|
| 地名 | 严重错误 | 同音替换 | 基本正确 |
| 人名 | 高噪声 | 可猜测 | 接近标准 |
| 品牌 | 失真 | 音译 | 正确输出 |
典型例子:
- 霍尔木兹海峡
- 真主党
- Loro Piana
结论:
medium的提升主要体现在“关键字正确性”,而不是整体句子质量。
4. 错误性质对比¶
三者错误类型可以归纳为:
base:语义破坏型错误(影响理解)small:同音替换型错误(可恢复)medium:局部细节错误(可修正)
这直接决定了后处理成本。
5. 输出风格问题(工程层面)¶
一个容易被忽略但非常关键的问题:
base:偏繁体输出small / medium:简体为主
影响:
- 需要额外做文本标准化
- 增加后处理复杂度
- 干扰人工校对
六、工程视角下的模型选型策略¶
结合性能与质量,可以形成明确的分层使用策略:
1. base:快速扫描模式¶
适合:
- 内容预览
- 粗略理解视频
- 批量初筛
不适合:
- 直接生成文稿
- 高信息密度内容
2. small:默认主力模型¶
适合:
- 大多数中文视频转写
- 批量处理
- 自动化流水线
优势:
- 95% 接近
medium - 成本仅一半
这是最推荐的默认选项。
3. medium:精修与最终稿¶
适合:
- 时政 /财经 /访谈等高信息密度内容
- 需要直接进入知识库或发布
- 人工校对成本高的场景
本质定位:
用算力换关键名词正确率
七、总结¶
这次实验的核心价值不在“哪个模型最好”,而在明确一件事:
Whisper 模型的升级,本质上是在用计算成本换取“关键语义正确率”,而不是整体可读性的跃迁。
具体来说:
base → small:跨过可用门槛small → medium:优化关键细节
在实际工程中,最优解通常不是“选最强模型”,而是:
在成本、速度与错误容忍度之间找到稳定平衡点
而在当前这一组模型中,这个平衡点就是 small。