Intelligence artificielle & traitement audio

Mesure automatique de l'intelligibilité

Un prototype pour suivre objectivement l'évolution de la parole sans dépendre de l'habitude d'écoute du soignant.

Contexte et objectif

Le projet répond à une demande de médecins accompagnant des patients atteints de cancers de la bouche ou de la langue. L'objectif est de fournir un repère stable pour observer une progression ou une régression de l'intelligibilité.

Méthode

L'audio est normalisé puis transcrit avec trois stratégies Whisper Base. La décodabilité et l'accord entre les transcriptions alimentent le score. NISQA et SRMR contrôlent séparément la qualité de l'enregistrement.

Technologies

Python, PyTorch, Whisper, FastAPI, librosa, NISQA, SRMR, JavaScript et Web Audio API.

Résultats et limites

La démo accepte une parole libre de quatre secondes minimum. Le score reste une estimation de recherche qui doit être calibrée sur des évaluations humaines avant tout usage clinique.