Speech-to-Text
Module de reconnaissance vocale utilisant le modèle Whisper d'OpenAI pour une transcription précise du français.
Qu'est-ce que Whisper ?
Whisper est un modèle de reconnaissance vocale automatique (ASR) développé par OpenAI. Il a été entraîné sur 680 000 heures d'audio multilingue et multitâche, ce qui lui permet de transcrire l'audio en texte avec une précision remarquable.
Multilingue
Supporte 99+ langues dont le français
Robuste
Résistant au bruit et aux accents
Tailles de modèle
| Modèle | Paramètres | VRAM | Vitesse |
|---|---|---|---|
tiny | 39M | ~1 GB | ~32x |
base | 74M | ~1 GB | ~16x |
smallrecommandé | 244M | ~2 GB | ~6x |
medium | 769M | ~5 GB | ~2x |
large | 1550M | ~10 GB | 1x |
* Vitesse relative par rapport au modèle "large". Plus le nombre est élevé, plus c'est rapide.
Configuration
name: whisper
model_size: small
language: fr
device: cpu # ou "cuda" pour GPU
compute_type: float32model_sizestringTaille du modèle Whisper à utiliser. Options : tiny, base, small, medium, large.
languagestringCode de langue ISO 639-1. Utiliser "fr" pour le français.
devicestringDevice de calcul. "cpu" pour processeur, "cuda" pour GPU NVIDIA.
Utilisation
Via la CLI
python3 -m src.cli.stt \
--audio data/raw/audio/sample.wav \
--model whisper \
--output results/stt/Via Python
from src.stt.models.whisper import WhisperSTT
# Initialiser le modèle
stt = WhisperSTT(model_size="small", language="fr")
# Transcrire un fichier audio
result = stt.transcribe("path/to/audio.wav")
print(result.text) # Texte transcrit
print(result.confidence) # Score de confianceFormats audio supportés
WAVMP3M4AFLACOGGWEBMMP4MPEGRecommandation
Pour de meilleurs résultats, utilisez le format WAV 16kHz mono.