DocsPipelineSTT (Whisper)

Speech-to-Text

Module de reconnaissance vocale utilisant le modèle Whisper d'OpenAI pour une transcription précise du français.

Qu'est-ce que Whisper ?

Whisper est un modèle de reconnaissance vocale automatique (ASR) développé par OpenAI. Il a été entraîné sur 680 000 heures d'audio multilingue et multitâche, ce qui lui permet de transcrire l'audio en texte avec une précision remarquable.

Multilingue

Supporte 99+ langues dont le français

Robuste

Résistant au bruit et aux accents

Tailles de modèle

ModèleParamètresVRAMVitesse
tiny39M~1 GB~32x
base74M~1 GB~16x
smallrecommandé244M~2 GB~6x
medium769M~5 GB~2x
large1550M~10 GB1x

* Vitesse relative par rapport au modèle "large". Plus le nombre est élevé, plus c'est rapide.

Configuration

configs/stt/whisper_small.yaml
name: whisper
model_size: small
language: fr
device: cpu  # ou "cuda" pour GPU
compute_type: float32
model_sizestring

Taille du modèle Whisper à utiliser. Options : tiny, base, small, medium, large.

languagestring

Code de langue ISO 639-1. Utiliser "fr" pour le français.

devicestring

Device de calcul. "cpu" pour processeur, "cuda" pour GPU NVIDIA.

Utilisation

Via la CLI

Terminal
python3 -m src.cli.stt \
  --audio data/raw/audio/sample.wav \
  --model whisper \
  --output results/stt/

Via Python

Python
from src.stt.models.whisper import WhisperSTT

# Initialiser le modèle
stt = WhisperSTT(model_size="small", language="fr")

# Transcrire un fichier audio
result = stt.transcribe("path/to/audio.wav")

print(result.text)       # Texte transcrit
print(result.confidence) # Score de confiance

Formats audio supportés

WAV
MP3
M4A
FLAC
OGG
WEBM
MP4
MPEG

Recommandation

Pour de meilleurs résultats, utilisez le format WAV 16kHz mono.

Performance

~0.5s
Temps de transcription (5s audio, small)
98%+
Précision WER français