Automatic Speech Recognition
Transformers.js
ONNX
Danish
whisper
speech-to-text
danish
webgpu
browser
Instructions to use varsan-g/hviske-v2-onnx with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers.js
How to use varsan-g/hviske-v2-onnx with Transformers.js:
// npm i @huggingface/transformers import { pipeline } from '@huggingface/transformers'; // Allocate pipeline const pipe = await pipeline('automatic-speech-recognition', 'varsan-g/hviske-v2-onnx');
Hviske v2 ONNX
ONNX export of syvai/hviske-v2 for use with Transformers.js in the browser.
Hviske v2 is a state-of-the-art Danish speech-to-text model, fine-tuned from openai/whisper-large-v3 on CoRal and Common Voice 17.0 datasets. Developed by syv.ai.
Performance
| Model | Parameters | CoRal CER | CoRal WER |
|---|---|---|---|
| syvai/hviske-v2 | 1540M | 4.7% | 11.8% |
| alexandrainst/roest-315 | 315M | 6.6% | 17.0% |
| openai/whisper-large-v3 | 1540M | 11.4% | 28.3% |
Usage with Transformers.js
import { pipeline } from '@huggingface/transformers'
const transcriber = await pipeline(
'automatic-speech-recognition',
'varsan-g/hviske-v2-onnx',
)
const result = await transcriber(audioData)
console.log(result.text)
Model Details
- Base model: openai/whisper-large-v3
- Fine-tuned by: syv.ai
- Language: Danish (da)
- License: OpenRAIL
- Format: ONNX (int8 quantized, single-file, no external data)
- Encoder: 615 MB
- Decoder: 932 MB
Conversion
Exported from PyTorch using Optimum and quantized with ONNX Runtime dynamic int8 quantization for browser compatibility:
optimum-cli export onnx --model syvai/hviske-v2 --task automatic-speech-recognition output/
File Structure
onnx/
encoder_model.onnx (615 MB)
decoder_model_merged.onnx (932 MB)
- Downloads last month
- 18