Votre ebook est écrit, mis en page, publié. Et une partie de vos lecteurs ne l'ouvrira jamais, tout simplement parce qu'ils écoutent au lieu de lire : en voiture, en marchant, en cuisinant. Un livre audio IA vous permet de leur parler à partir du texte que vous possédez déjà, sans studio, sans comédien et sans matériel.
Le principe paraît simple. L'exécution l'est beaucoup moins, parce qu'une voix de synthèse lit tout ce qu'on lui donne : les numéros de page, les légendes d'images, les abréviations et les renvois du type « voir figure 2 ». L'essentiel du travail se joue donc avant la génération, dans la préparation du texte, puis après, à l'écoute. Si la synthèse vocale est nouvelle pour vous, notre guide complet de la voix off IA pose les bases que cet article suppose acquises.
Transformer un ebook en livre audio : la réponse courte
Vous sortez le texte de votre livre chapitre par chapitre, vous le nettoyez de tout ce qui ne se prononce pas, vous choisissez une voix unique et une consigne de lecture, puis vous générez un fichier audio par chapitre. La génération d'un chapitre se compte en minutes. La relecture à l'oreille, elle, prend le temps réel de l'écoute, et c'est ce budget de temps qu'il faut prévoir. Si le livre reste à écrire, notre méthode pour créer un ebook avec l'IA part du sujet et va jusqu'à la mise en page.
Les cinq étapes, du fichier texte au chapitre écouté
Un livre audio n'est pas un texte passé dans une machine, c'est une chaîne de cinq gestes qui s'enchaînent. Sauter le deuxième donne un fichier que personne n'écoute jusqu'au bout. Sauter le cinquième donne un fichier avec trois prénoms mal prononcés, et c'est la première chose que vos lecteurs vous signaleront.

Cette chaîne vaut pour un roman comme pour un guide pratique. Seule la façon de préparer le texte change vraiment d'un genre à l'autre, parce qu'un livre pratique contient beaucoup plus d'éléments visuels qu'un récit.
Étape 1 : sortir le texte, un fichier par chapitre
Travaillez chapitre par chapitre, jamais avec le livre entier en un seul bloc. Trois raisons à cela. Un auditeur navigue par chapitres, donc votre livre audio doit être découpé ainsi. Une erreur de prononciation ne vous oblige alors qu'à régénérer un chapitre, pas cent pages. Et les plateformes de distribution attendent précisément cette découpe : d'après les exigences de production publiées par ACX, la plateforme de production audio d'Audible, chaque fichier livré doit correspondre à un chapitre ou à une section du livre.
Chez nous, un ebook produit dans le studio est livré sous deux formes : un livre consultable en ligne et un PDF téléchargeable. Le texte se récupère donc chapitre par chapitre depuis cette version, puis se colle dans l'outil de voix off. Autant le dire franchement : il n'existe pas de bouton qui transforme un livre entier en audio d'un seul clic. Ce passage reste manuel, et c'est aussi ce qui vous laisse le contrôle sur ce que la voix reçoit.
Étape 2 : réécrire pour l'oreille ce qui était écrit pour l'œil
Un livre écrit s'appuie sur des repères visuels que l'oreille ne perçoit pas. Le lecteur voit un titre en gras, une puce, un tableau, une note en bas de page. L'auditeur, lui, ne reçoit qu'un flux de paroles. Tout ce qui n'a de sens que pour l'œil doit donc être retiré ou reformulé avant la génération.

Cette passe de nettoyage prend une dizaine de minutes par chapitre et évite la quasi totalité des retours d'auditeurs. Voici ce qu'il faut traiter systématiquement.
- Les numéros et titres de chapitre : écrivez « Chapitre trois » en toutes lettres, sinon la voix annonce un chiffre isolé.
- Les renvois visuels : « voir figure 2 », « comme le montre le tableau ci dessous », « page 47 ». Ils n'existent pas à l'écoute, supprimez les.
- Les abréviations : cf., env., etc., les sigles épelés à tort. Écrivez la forme parlée.
- Les nombres et les dates : une année, un pourcentage ou une somme se lisent mieux écrits en lettres quand le rendu vous importe.
- Les listes à puces : transformez chaque point en phrase complète, avec un point final, sinon tout s'enchaîne sans respiration.
- Les liens et adresses web : ils donnent un charabia à l'écoute, remplacez les par une formule parlée.
- Les notes de bas de page : intégrez l'information dans le corps du texte, ou retirez la.
Étape 3 : une voix, et la même du début à la fin
Le choix de la voix engage tout le livre. Un auditeur passe plusieurs heures avec elle, et il repère immédiatement un changement de timbre entre deux chapitres. Testez trois ou quatre voix sur un même extrait d'environ trois cents mots, écoutez les au casque, puis figez votre choix avant de lancer le reste. Sur EasyVids, une gamme de voix propose des timbres décrits par leur caractère, du grave et posé à l'énergique, une autre met en avant des voix de narration françaises, et une troisième se concentre sur le clonage.
Le rendu ne dépend pas seulement du timbre. Une voix qui débite sans respiration passe pour artificielle, même quand sa qualité sonore est excellente. Les réglages qui font la différence entre une lecture mécanique et une narration crédible sont détaillés dans notre article sur les voix IA qui sonnent robotiques, et ils s'appliquent mot pour mot à un livre audio.
Le style de lecture, la consigne qui change tout
Certaines gammes de voix acceptent une consigne écrite en langage naturel, posée en tête du texte, qui oriente l'interprétation sans jamais être prononcée. C'est le levier le plus rentable de toute la chaîne. « Lis comme un conteur captivant, d'une voix chaleureuse et posée » ne donne pas du tout la même lecture que « Lis comme un présentateur de journal télévisé, ton sérieux et rythmé ».
Deux précautions. Écrivez la consigne une fois et gardez la identique sur tous les chapitres, sinon le livre change de ton en cours de route. Et enregistrez la comme préférence sur votre compte plutôt que de la recopier à chaque fois : elle s'applique alors automatiquement à toutes vos générations, ce qui supprime le risque d'oubli sur le chapitre onze.
Étape 4 : générer un chapitre entier d'un seul tenant
C'est ici que la plupart des outils calent. Les moteurs de synthèse vocale plafonnent en général autour de quelques milliers de caractères par requête, très en dessous d'un chapitre de livre. La solution ne consiste pas à découper votre texte à la main en vingt morceaux, puis à recoller vingt fichiers audio.

Sur notre outil de voix off, un texte long est découpé automatiquement à la fin d'une phrase, jamais au milieu d'un mot, en morceaux d'environ trois mille caractères. Ces morceaux sont générés en parallèle avec la même voix et le même style, puis assemblés en un seul fichier. Une génération accepte jusqu'à cent mille caractères, soit à peu près une heure et demie d'écoute, ce qui couvre largement un chapitre. Autre détail qui compte sur un livre entier : les morceaux déjà produits sont conservés, donc une interruption ne vous fait pas tout recommencer. La voix off est facturée au caractère, et le détail des formules est sur la page des tarifs.
Étape 5 : l'écoute de contrôle, la seule étape non automatisable
Écoutez chaque chapitre en entier, au casque, texte sous les yeux. C'est fastidieux, c'est indispensable, et c'est ce qui sépare un livre audio publiable d'un fichier que l'on abandonne à la troisième minute. Notez au fil de l'écoute, corrigez le texte source, régénérez le chapitre.
- Les noms propres et les prénoms, presque toujours à corriger sur un récit.
- Les sigles : certains sont épelés, d'autres prononcés comme un mot, et le choix n'est pas toujours le bon.
- Les nombres, les dates et les unités de mesure.
- Les mots étrangers glissés dans une phrase française.
- Les phrases interrogatives, dont l'intonation tombe parfois à plat.
- Les jonctions entre deux morceaux générés, à écouter avec attention la première fois que vous utilisez une voix.
La correction se fait dans le texte, pas dans un logiciel audio. Un nom mal prononcé se règle en l'écrivant phonétiquement à cet endroit précis. Une phrase qui s'emballe se règle par un point à la place d'une virgule. Vous travaillez toujours la source, jamais le fichier produit, ce qui rend chaque correction reproductible.
Les exigences techniques d'un fichier livrable
Si vous visez une plateforme d'écoute, ses contrôles automatiques refusent les fichiers hors normes avant même toute écoute humaine. D'après les exigences de contrôle qualité publiées par ACX, un fichier doit tenir un niveau moyen compris entre -23 dB et -18 dB RMS, des pics qui ne dépassent pas -3 dB, un bruit de fond sous -60 dB RMS, un format MP3 à 192 kbps constant en 44,1 kHz, et rester sous cent vingt minutes par fichier. Un bref silence est également attendu en tête et en fin de fichier.
Une voix de synthèse coche naturellement plusieurs de ces cases : aucun bruit de fond, aucun souffle de micro, un niveau régulier d'un bout à l'autre. Nos fichiers assemblés sortent d'ailleurs en MP3 192 kbps, ce qui correspond au format attendu. Vérifiez tout de même les niveaux dans un éditeur audio gratuit avant un dépôt, et sachez que les conditions de chaque plateforme évoluent : consultez toujours leur documentation à jour avant de livrer.
Votre voix clonée, ou une voix de catalogue
Cloner votre propre voix change la nature du projet : votre livre audio devient une extension de votre identité d'auteur, et vos lecteurs vous reconnaissent. Techniquement, un court échantillon propre suffit sur les gammes qui proposent le clonage, et la voix obtenue reste disponible dans tout le studio. La contrepartie est un temps d'enregistrement soigné, dans une pièce calme, sans écho.
Une précaution juridique s'impose ici. Vous ne pouvez cloner que votre voix, ou celle d'une personne qui vous a donné son accord explicite. C'est la raison pour laquelle une case de certification accompagne le clonage dans le studio. Les limites exactes, le consentement et les cas où la loi s'en mêle sont traités dans notre article sur la légalité du clonage de voix.
Où publier un livre audio produit avec l'IA
Les grandes plateformes se sont ouvertes à la narration synthétique, avec des conditions propres à chacune. Amazon propose depuis fin 2023, d'après les pages d'aide de KDP, une narration en voix virtuelle pour certains livres Kindle, avec des critères d'éligibilité qui varient selon les pays et les catégories. Apple Books met en avant depuis 2023 une narration numérique destinée aux auteurs indépendants, selon la page qu'Apple consacre à ce programme. Les règles de déclaration côté Amazon sont détaillées dans notre article sur les livres IA et les règles KDP.
Rien ne vous oblige à passer par elles. Un livre audio se vend très bien en fichier téléchargeable depuis votre propre site, s'offre en bonus à l'achat de l'ebook, ou se publie en épisodes. Cette dernière option demande un habillage sonore et une structure d'épisodes que notre guide de la voix IA pour podcast détaille pas à pas. Pour une diffusion vidéo, l'éditeur en ligne accepte les pistes audio : vous posez le fichier d'un chapitre sur une couverture fixe et vous obtenez une vidéo publiable.
Une dernière recommandation, valable partout : indiquez que la narration est synthétique. La transparence n'a jamais fait fuir un auditeur prévenu, alors qu'une découverte en cours d'écoute se transforme souvent en commentaire négatif. Plusieurs plateformes l'exigent d'ailleurs formellement dans leurs conditions de dépôt.
Questions fréquentes
Combien de temps faut-il pour produire un livre audio complet ?
La génération est rapide : quelques minutes par chapitre. Le temps réel se passe ailleurs. Comptez une dizaine de minutes de préparation par chapitre, plus la durée d'écoute complète du résultat. Pour un livre d'une centaine de pages, prévoyez deux à trois journées de travail réparties, l'essentiel étant consacré au contrôle.
Une voix de synthèse est-elle acceptée par les plateformes d'écoute ?
De plus en plus, mais jamais sans conditions. Amazon et Apple ont chacun ouvert un programme de narration synthétique pour les auteurs, avec des critères d'éligibilité et une obligation de déclaration. Les conditions changent régulièrement : lisez la documentation officielle de la plateforme visée avant de préparer votre dépôt.
Faut-il un micro ou un logiciel de montage audio ?
Non pour la narration, qui est entièrement produite côté serveur et vous revient en fichier prêt à écouter. Un micro devient utile uniquement si vous clonez votre propre voix, et il vous faut alors un enregistrement propre dans une pièce sans écho. Un éditeur audio gratuit reste pratique pour vérifier les niveaux avant un dépôt.
Comment corriger un nom propre mal prononcé ?
En écrivant ce nom phonétiquement dans le texte source, à l'endroit concerné, puis en régénérant le chapitre. Testez la graphie sur une phrase isolée avant de relancer le chapitre entier. Gardez une petite liste de ces graphies : elle vous servira sur tous vos livres suivants.
Peut-on produire son livre audio dans plusieurs langues ?
Oui, à condition de traduire d'abord le texte, puis de choisir une voix native de la langue visée. Une voix française lisant un texte anglais donne un accent immédiatement perceptible. Prévoyez aussi une écoute de contrôle par une personne qui parle la langue, car les erreurs de prononciation vous échapperont sinon.
Un livre audio n'est pas un produit de plus à fabriquer, c'est le même livre offert à des gens qui n'ouvriront jamais un fichier texte. Le travail tient dans la préparation et dans l'écoute, la technique s'occupe du reste. Pour tester la démarche sur un seul chapitre avant d'engager le livre entier, créez votre compte et générez le sur le studio EasyVids, qui réunit l'écriture, la voix et l'édition au même endroit.
