Hviske v2 ONNX

ONNX export of syvai/hviske-v2 for use with Transformers.js in the browser.

Hviske v2 is a state-of-the-art Danish speech-to-text model, fine-tuned from openai/whisper-large-v3 on CoRal and Common Voice 17.0 datasets. Developed by syv.ai.

Performance

Model Parameters CoRal CER CoRal WER
syvai/hviske-v2 1540M 4.7% 11.8%
alexandrainst/roest-315 315M 6.6% 17.0%
openai/whisper-large-v3 1540M 11.4% 28.3%

Usage with Transformers.js

import { pipeline } from '@huggingface/transformers'

const transcriber = await pipeline(
  'automatic-speech-recognition',
  'varsan-g/hviske-v2-onnx',
)

const result = await transcriber(audioData)
console.log(result.text)

Model Details

  • Base model: openai/whisper-large-v3
  • Fine-tuned by: syv.ai
  • Language: Danish (da)
  • License: OpenRAIL
  • Format: ONNX (int8 quantized, single-file, no external data)
  • Encoder: 615 MB
  • Decoder: 932 MB

Conversion

Exported from PyTorch using Optimum and quantized with ONNX Runtime dynamic int8 quantization for browser compatibility:

optimum-cli export onnx --model syvai/hviske-v2 --task automatic-speech-recognition output/

File Structure

onnx/
  encoder_model.onnx           (615 MB)
  decoder_model_merged.onnx    (932 MB)
Downloads last month
18
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for varsan-g/hviske-v2-onnx

Finetuned
syvai/hviske-v2
Quantized
(1)
this model