DatasetLwaziANV

← Back to examples

How do the models score overall?

Two industry-standard measures, plus latency, across every model in the benchmark. Numbers come from the full evaluation set (3025 isiZulu clips from African Next Voices).

< 15% — Excellent 15–30% — Good 30–50% — Rough > 50% — Struggling
� Model Size vs Performance

How does model size relate to WER?

� Word Error Rate (WER)

Percentage of words the model got wrong. Lower is better.

ModelWERNErrors
facebook/omniASR-LLM-7BOpen39.1%30250
facebook/omniASR-LLM-3BOpen43.8%30250
facebook/omniASR-LLM-1BOpen43.9%30250
dsfsi/anv-whisper-large-v3-turbo-anv-zulOpen46.8%30250
facebook/omniASR-LLM-300MOpen48.0%30250
facebook/omniASR-CTC-1BOpen48.1%30250
facebook/omniASR-CTC-3BOpen50.4%30250
sitwala/whisper-large-v3-turbo-anv-zul-250hOpen50.4%30250
sitwala/whisper-large-v3-turbo-anv-zul-150hOpen51.2%30250
facebook/omniASR-CTC-300MOpen55.3%30250
sitwala/whisper-large-v3-turbo-anv-zul-50hOpen57.3%30250
dsfsi/anv-whisper-small-anv-zulu-first-batchOpen60.2%30250
openai/whisper-large-v3Open126.1%30250
sitwala/whisper-large-anv-sotOpen172.9%30250
openai/whisper-smallOpen186.5%30250
sitwala/whisper-large-v3-anv-sotOpen197.1%30250
Average across models79.8%
Best: facebook/omniASR-LLM-7B (39.1%)
🔤 Character Error Rate (CER)

Percentage of individual characters wrong. Lower is better.

ModelCERNErrors
facebook/omniASR-LLM-7BOpen13.7%30250
facebook/omniASR-LLM-1BOpen14.7%30250
facebook/omniASR-LLM-3BOpen14.7%30250
facebook/omniASR-CTC-1BOpen15.0%30250
facebook/omniASR-LLM-300MOpen16.4%30250
facebook/omniASR-CTC-300MOpen16.9%30250
facebook/omniASR-CTC-3BOpen18.5%30250
dsfsi/anv-whisper-large-v3-turbo-anv-zulOpen19.8%30250
sitwala/whisper-large-v3-turbo-anv-zul-250hOpen22.2%30250
sitwala/whisper-large-v3-turbo-anv-zul-150hOpen22.6%30250
sitwala/whisper-large-v3-turbo-anv-zul-50hOpen25.3%30250
dsfsi/anv-whisper-small-anv-zulu-first-batchOpen26.2%30250
openai/whisper-large-v3Open49.2%30250
sitwala/whisper-large-anv-sotOpen54.9%30250
sitwala/whisper-large-v3-anv-sotOpen57.9%30250
openai/whisper-smallOpen96.8%30250
Average across models30.3%
Best: facebook/omniASR-LLM-7B (13.7%)
⚡ Latency

Average time it takes per sample.

ModelAvg latency (per sample)
facebook/omniASR-CTC-300MOpen0.05s
facebook/omniASR-CTC-1BOpen0.07s
sitwala/whisper-large-v3-turbo-anv-zul-250hOpen0.09s
sitwala/whisper-large-v3-turbo-anv-zul-150hOpen0.09s
sitwala/whisper-large-v3-turbo-anv-zul-50hOpen0.11s
dsfsi/anv-whisper-large-v3-turbo-anv-zulOpen0.11s
facebook/omniASR-CTC-3BOpen0.12s
dsfsi/anv-whisper-small-anv-zulu-first-batchOpen0.16s
openai/whisper-smallOpen0.35s
sitwala/whisper-large-anv-sotOpen0.39s
sitwala/whisper-large-v3-anv-sotOpen0.49s
openai/whisper-large-v3Open0.61s
facebook/omniASR-LLM-1BOpen1.47s
facebook/omniASR-LLM-3BOpen1.50s
facebook/omniASR-LLM-7BOpen1.60s
facebook/omniASR-LLM-300MOpen2.39s
What do these numbers mean?

WER (Word Error Rate): out of every 100 spoken words, how many did the model get wrong?

CER (Character Error Rate): same idea but at the character level.

Lower is always better. 0% would mean a perfect transcription.

← Back to example gallery