Pour connaître le volume actuel d'un fichier audio ou vidéo sans le modifier, FFmpeg propose deux filtres spécialisés selon ce que vous cherchez : le volume classique en décibels (dB) ou le volume ressenti moderne (LUFS)



Méthode 1 : Le volume perçu (Norme LUFS / EBU R128)

C'est la méthode moderne utilisée par YouTube, Spotify et la télévision. Elle analyse la puissance sonore réellement perçue par l'oreille humaine


ffmpeg -i entree.mp3 -af ebur128=framelog=quiet -f null -


Ce qu'il faut regarder à la fin du texte affiché :


I: (Integrated Loudness) : Le volume global moyen du fichier. (Exemple : -19.5 LUFS). Plus le chiffre est proche de 0, plus le fichier est fort.


LRA: (Loudness Range) : L'écart de dynamique entre les moments les plus calmes et les plus forts.


Méthode 2 : Les pics et décibels traditionnels (volumedetect)


C'est la méthode mathématique classique. Elle est idéale pour savoir si votre fichier sature ou s'il y a de la marge pour augmenter le volume.


ffmpeg -i entree.mp3 -af volumedetect -f null -


Ce qu'il faut regarder dans le bloc de texte généré :


max_volume: Le pic le plus fort du fichier (True Peak analog). S'il affiche 0.0 dB, le fichier touche le plafond numérique et risque de saturer. S'il affiche -6.0 dB, vous pouvez augmenter le volume global de 6 dB sans aucun risque.


mean_volume: Le volume moyen brut de tout le fichier.


Les valeurs cibles du filtre loudnorm (I, LRA, TP) se configurent selon le type de média et sa plateforme de diffusion. L'objectif est de s'aligner sur la perception humaine tout en respectant les exigences des algorithmes de diffusion modernes.


1. Podcast et Voix seule (Streaming web)

Les voix nécessitent de l'espace pour respirer. Un LRA trop faible écraserait la dynamique naturelle et ferait remonter désagréablement les bruits de fond, la respiration ou le souffle du micro

I=-16 : La norme mondiale pour les podcasts d'entreprises, Apple Podcasts et Amazon Alexa.LRA=11 ou 12 : Une plage dynamique large pour préserver l'intonation naturelle de la parole.TP=-1.5 : Marge de sécurité idéale pour éviter l'écrêtage (clipping) lorsque les fichiers sont fortement compressés au format MP3 ou AAC par les hébergeurs

LRA=11 ou 12 : Une plage dynamique large pour préserver l'intonation naturelle de la parole.

TP=-1.5 : Marge de sécurité idéale pour éviter l'écrêtage (clipping) lorsque les fichiers sont fortement compressés au format MP3 ou AAC par les hébergeurs.

Commande type : loudnorm=I=-16:LRA=11:TP=-1.5


2. Musique pour les plateformes de Streaming

Les morceaux musicaux modernes nécessitent une plus grande cohésion et une dynamique plus serrée (un LRA plus bas) pour conserver leur énergie.

I=-14 : La cible exacte de normalisation de Spotify, YouTube et Tidal.

LRA=7 à 9 : Réduit les écarts trop brusques entre les couplets et les refrains pour que le morceau reste dense.

TP=-1.0 : Suffisant pour protéger le signal lors de la conversion en formats lossy courants.

Commande type : loudnorm=I=-14:LRA=8:TP=-1


3. Télévision européenne (Norme EBU R128)

Si vous produisez du contenu pour la télévision, un court-métrage ou un documentaire destiné à la diffusion classique (Broadcast), vous devez obligatoirement respecter la législation

I=-23 : La cible légale européenne stricte. Le son paraîtra beaucoup plus faible qu'un clip YouTube, c'est tout à fait normal.

LRA=15 à 20 : Laisse une liberté totale à la dynamique (explosion, silences dramatiques, dialogues de films).

TP=-1.0 (ou -2.0 selon la chaîne) : Protection maximale.


Commande type : loudnorm=I=-23:LRA=15:TP=-1


4. Vidéo d'ambiance ou "Gaming" (YouTube, Réseaux Sociaux)Idéal pour les vidéos mêlant de la voix off, de la musique de fond et des effets sonores (bruitages, explosions)


I=-14 : La cible de volume de YouTube et d'Instagram.

LRA=10 : Un bon compromis qui permet à la musique de fond de baisser légèrement quand la voix parle, sans créer un effet "pompage" agressif.

TP=-1.0

Commande type : loudnorm=I=-14:LRA=10:TP=-1


Cela s'applique t-il de la même façon quelque soit le type de fichier: mp3, aac, ogg, etc


La réponse courte est oui pour la cible de volume global (I), mais non pour le True Peak (TP). Vous devez adapter la protection contre les pics selon le format choisi.


1. La règle universelle : Le volume perçu (I) ne change pas

L'integrated loudness (I=-23 ou I=-14) est une mesure purement mathématique du volume perçu par l'oreille humaine [8.0]. Elle s'applique de manière strictement identique, que vous exportiez en MP3, AAC, OGG, FLAC ou WAV. Le volume ressenti au final sera exactement le même.


2. Le piège des formats destructeurs (MP3, AAC, OGG) : Modifiez le TP !

Les formats compressés dits lossy (destructeurs) modifient la forme d'onde physique de l'audio pour réduire la taille du fichier. Cette dégradation crée de légères variations qui font remonter artificiellement les pics d'environ 0,5 dB à 1 dB après l'encodage.

Pour éviter que votre fichier final ne sature de manière inaudible (inter-sample clipping), vous devez ajuster votre paramètre de True Peak


Formats non compressés / Lossless (WAV, FLAC, ALAC) :Le signal reste parfait. Vous pouvez coller au plafond théorique.TP=-1.0

TP=-1.0 est idéal.


Formats compressés standard (AAC, OGG) :La compression est moderne et performante, mais génère de petits écarts de pics

TP=-1.5 offre une marge de sécurité nécessaire.


Format ancien (MP3) :L'algorithme du MP3 est très imprévisible sur la reconstruction des pics. Le volume des pointes augmente souvent de près de 1 dB après compression.

TP=-2.0 est fortement recommandé pour garantir qu'aucune plateforme ou enceinte ne fasse saturer le fichier MP3 final.


Résumé des ajustements par format

Pour du WAV / FLAC : loudnorm=I=-23:LRA=15:TP=-1.0

Pour du AAC / OGG : loudnorm=I=-23:LRA=15:TP=-1.5

Pour du MP3 : loudnorm=I=-23:LRA=15:TP=-2.0