跳转至

Whisper 三模型(base / small / medium)中文转写性能对比与选型实践

在实际语音转写项目中,模型选择往往直接决定了处理效率与文本质量的上限。本文基于一次真实中文视频转写实验,对 basesmallmedium 三个模型在速度、准确率以及适用场景上的表现进行系统性分析,并给出工程层面的选型建议。


一、问题背景与核心结论

本次测试样本为一段 13 分 41 秒的中文时政口播视频,在统一硬件环境(RTX 4060 + CUDA + float16)下完成三模型转写。

从结果来看,三者表现呈现出典型的“性能-质量梯度”:

  • 速度排序: base > small > medium
  • 质量排序: medium ≳ small >> base

但需要强调的是:
medium 并非全面碾压 small,其优势主要集中在 高信息密度词汇(专名、地名、人名) 上,而 small 在绝大多数普通语句中已经接近最终可用水平。

结论可以压缩为三点:

  • 快速初稿 → 用 base
  • 平衡效率与质量 → 用 small
  • 高质量底稿 → 用 medium

二、测试环境与执行条件

本次测试严格控制变量,确保对比有效:

  • 视频时长:13:41
  • 文件大小:98.64 MB
  • 指定语言:zh(关闭自动检测)
  • 推理设备:CUDA(float16)
  • GPU:RTX 4060
  • 执行方式:统一调用 transcribe_file() 接口

所有模型均未触发 CPU fallback,保证结果可比。


三、性能表现:速度与规模

整体性能数据如下:

模型 耗时(秒) 实时倍速 相对 base
base 22.99 35.72x 1.00x
small 35.25 23.30x 1.53x
medium 74.21 11.07x 3.23x

可以明确几个关键事实:

第一,small 是明显的“性价比拐点”,仅比 base 慢 1.5 倍,却已经接近 medium 的质量。

第二,medium 的性能成本非常高,是 small2.11 倍,属于典型“边际收益递减”。

第三,三者输出文本长度几乎一致(差异 <1%),说明:

模型差异不在“是否转写出来”,而在“是否转写正确”。


四、文本相似度分析

字符级相似度如下:

  • base vs small:约 61%
  • base vs medium:约 60%
  • small vs medium:95.34%

这里需要避免误解:

  • base 的低相似度并不等价于语义错误率 40%

主要原因包括:

  • 繁体 vs 简体差异
  • 同音字替换
  • 分词与断句差异

但即便扣除这些因素,base 在关键实体识别上的错误仍明显更高。


五、质量差异的本质来源

1. 关键事实识别(时间 / 数字 / 术语)

base 在高权重信息点上错误更集中,例如:

  • 年份错误(2016 → 2026)
  • “通牒”识别失败
  • 地名严重偏差

medium 在这些关键节点上基本稳定。


2. 常见语言模式(口语 / 固定搭配)

例如“买不了吃亏,买不了上当”:

  • base:语义破碎
  • small:完整保留
  • medium:完整 + 结构更清晰

说明:

small 已经跨过“可读性门槛”,而 base 尚未。


3. 专有名词(核心差异点)

这是三模型真正拉开差距的地方:

类型 base small medium
地名 严重错误 同音替换 基本正确
人名 高噪声 可猜测 接近标准
品牌 失真 音译 正确输出

典型例子:

  • 霍尔木兹海峡
  • 真主党
  • Loro Piana

结论:

medium 的提升主要体现在“关键字正确性”,而不是整体句子质量。


4. 错误性质对比

三者错误类型可以归纳为:

  • base:语义破坏型错误(影响理解)
  • small:同音替换型错误(可恢复)
  • medium:局部细节错误(可修正)

这直接决定了后处理成本。


5. 输出风格问题(工程层面)

一个容易被忽略但非常关键的问题:

  • base:偏繁体输出
  • small / medium:简体为主

影响:

  • 需要额外做文本标准化
  • 增加后处理复杂度
  • 干扰人工校对

六、工程视角下的模型选型策略

结合性能与质量,可以形成明确的分层使用策略:

1. base:快速扫描模式

适合:

  • 内容预览
  • 粗略理解视频
  • 批量初筛

不适合:

  • 直接生成文稿
  • 高信息密度内容

2. small:默认主力模型

适合:

  • 大多数中文视频转写
  • 批量处理
  • 自动化流水线

优势:

  • 95% 接近 medium
  • 成本仅一半

这是最推荐的默认选项。


3. medium:精修与最终稿

适合:

  • 时政 /财经 /访谈等高信息密度内容
  • 需要直接进入知识库或发布
  • 人工校对成本高的场景

本质定位:

用算力换关键名词正确率


七、总结

这次实验的核心价值不在“哪个模型最好”,而在明确一件事:

Whisper 模型的升级,本质上是在用计算成本换取“关键语义正确率”,而不是整体可读性的跃迁。

具体来说:

  • base → small:跨过可用门槛
  • small → medium:优化关键细节

在实际工程中,最优解通常不是“选最强模型”,而是:

在成本、速度与错误容忍度之间找到稳定平衡点

而在当前这一组模型中,这个平衡点就是 small