Améliorations
Pistes d'amélioration pour optimiser chaque composant de la pipeline THOR.
État actuel
Speech-to-Text (STT)
Potentiel d'amélioration
Utiliser Whisper Large v3
Le modèle Whisper Large v3 offre une précision significativement meilleure, surtout pour les noms propres français.
Fine-tuner Whisper sur le domaine ferroviaire
Entraîner Whisper sur un dataset de phrases ferroviaires améliorerait considérablement la reconnaissance des termes spécifiques.
Implémenter Whisper.cpp ou Faster-Whisper
Les implémentations optimisées de Whisper offrent des gains de performance significatifs sans perte de qualité.
Support multilingue
Whisper supporte nativement 99 langues. Activer la détection automatique de langue permettrait des requêtes internationales.
Natural Language Processing (NLP)
Potentiel d'amélioration
Utiliser un modèle Transformer (CamemBERT)
Les modèles Transformer comme CamemBERT offrent une compréhension contextuelle supérieure à spaCy.
Extraire plus d'entités (date, heure, classe)
Actuellement seules ORIGIN et DESTINATION sont extraites. Ajouter DATE, TIME, CLASS enrichirait les fonctionnalités.
Ajouter un intent classifier
Un classifieur d'intention permettrait d'étendre THOR à d'autres cas d'usage que la recherche d'itinéraire.
Augmenter le dataset d'entraînement
Le dataset actuel contient ~1000 exemples. L'augmenter avec des paraphrases améliorerait la généralisation.
Pathfinding
Potentiel d'amélioration
Intégrer les horaires réels (time-dependent routing)
Actuellement le pathfinding utilise des temps moyens. Intégrer les horaires GTFS permettrait des itinéraires temporels.
Utiliser A* avec heuristique géographique
L'algorithme A* avec distance Haversine comme heuristique serait plus efficace que Dijkstra pur.
Optimisation multi-critères (Pareto)
Au lieu d'un seul itinéraire optimal, proposer un front de Pareto avec différents compromis.
Améliorer la couverture des géométries
Certaines liaisons n'ont pas de géométrie associée. Améliorer le matching ou interpoler les tracés manquants.
Étendre au réseau européen
Intégrer les données GTFS des réseaux voisins (Eurostar, Thalys, DB, SBB) pour des itinéraires internationaux.
Infrastructure & UX
Streaming de la réponse STT
Afficher la transcription en temps réel pendant que l'utilisateur parle, comme les assistants vocaux modernes.
Cache des résultats fréquents
Les trajets populaires représentent 80% des requêtes. Les mettre en cache réduirait la latence à ~10ms.
Progressive Web App (PWA)
Transformer le site en PWA permettrait une utilisation hors-ligne et une expérience native sur mobile.
Tests end-to-end automatisés
Actuellement les tests sont manuels. Automatiser avec Playwright et un test set golden.
Matrice de priorité
Quick Wins (Facile + Impact élevé)
- • Whisper Large v3
- • Augmentation du dataset NLP
- • Cache des trajets fréquents
Projets majeurs (Difficile + Impact élevé)
- • Fine-tuning Whisper ferroviaire
- • Horaires temps réel
- • CamemBERT NER
Nice to have (Facile + Impact faible)
- • Support multilingue
- • PWA
Long terme (Difficile + Impact faible)
- • Réseau européen
- • Optimisation Pareto complète