Vous avez publié la vidéo. Le sujet est solide, le montage tient, la voix passe bien. Et la courbe de fidélisation s'effondre avant la trentième seconde. Dans la plupart des cas, ni la caméra ni le micro n'y sont pour quelque chose : c'est le script YouTube qui est mal ordonné. Les bonnes phrases sont là, elles arrivent simplement trop tard.
Un script YouTube qui retient tient en trois parties, toujours les mêmes : un hook, un corps, un appel à l'action. Ce n'est pas une recette de plus, c'est une répartition du travail. Chaque partie a un seul rôle, et une partie qui fait le travail d'une autre casse la vidéo. Si vous cherchez d'abord les principes généraux de l'écriture vidéo, tous formats confondus, notre guide complet du script vidéo les rassemble. Cet article fait autre chose : il donne le squelette propre à YouTube, puis déroule un script entier, du premier mot au dernier.
Le modèle hook, corps, appel à l'action, en résumé
Un script YouTube efficace s'écrit en trois blocs. Le hook occupe les quinze premières secondes et fait quatre choses : nommer le problème du spectateur, promettre un résultat, prouver que vous pouvez le tenir, annoncer le plan. Le corps représente environ quatre cinquièmes des mots et se découpe en trois à cinq blocs autonomes, chacun ouvert par une question et fermé par une transition. L'appel à l'action tient en une cinquantaine de mots, rappelle la promesse du hook et ne demande qu'une seule chose. Comptez environ 150 mots par minute de narration pour calibrer le tout.
Pourquoi un script YouTube ne s'écrit pas comme un script vertical
Sur une vidéo verticale, le spectateur arrive par hasard. Sur YouTube, il arrive parce qu'il a lu un titre et vu une miniature : il a déjà une attente précise, et il vient vérifier si vous allez la tenir. Cette différence change l'ordre d'écriture. Le hook d'une vidéo YouTube ne sert pas à surprendre, il sert à confirmer. En quinze secondes, le spectateur doit reconnaître sa propre question et comprendre qu'il est au bon endroit.
La seconde différence est la durée. Une vidéo de huit minutes ne se tient pas par la seule énergie du présentateur : elle a besoin d'une charpente, de relances régulières, d'un rythme qui se sent. C'est exactement ce qu'un format court n'exige pas, et la formule en trois temps des vidéos de trente secondes fonctionne selon une autre logique, plus dense et plus abrupte. Écrire l'une avec les réflexes de l'autre donne soit un YouTube haletant et creux, soit un format court qui traîne.
Anatomie : ce que chaque partie doit contenir
La façon la plus simple de vérifier un script est de le relire en se demandant, pour chaque phrase, à quelle partie elle appartient. Une phrase qui n'appartient à aucune des trois est une phrase à couper. C'est brutal, et c'est ce qui fait gagner le plus de temps de visionnage.

Notez la répartition des mots. Le corps pèse environ quatre cinquièmes du script, alors que le hook et l'appel à l'action réunis tiennent en moins de cent mots. C'est une bonne nouvelle : ces cent mots sont les seuls que vous devez ciseler phrase par phrase. Le reste s'écrit vite.
Le hook : quinze secondes, quatre gestes
Le hook est la seule partie qu'il faut écrire en dernier. Tant que la vidéo n'est pas écrite, vous ne savez pas encore ce qu'elle promet vraiment, et vous promettez donc à côté. Une fois le corps posé, la promesse devient évidente : c'est le bénéfice du bloc le plus fort.

- Le problème : la situation du spectateur, dite avec ses mots à lui. Pas votre sujet, pas votre chaîne, pas votre intention.
- La promesse : ce qu'il saura faire une fois la vidéo finie. Un verbe d'action, un résultat observable.
- La preuve : une phrase qui rend la promesse crédible. Une expérience, un chiffre que vous avez mesuré, un résultat que vous montrez à l'écran.
- Le plan : les trois points annoncés en une phrase. Le spectateur accepte un trajet long s'il en voit la carte.
- Ce qui n'y a pas sa place : le générique animé, le « salut à tous », la présentation de la chaîne, les remerciements. Tout cela existe, mais après le hook.
Une variante utile consiste à ouvrir sur le résultat plutôt que sur le problème : vous montrez d'abord ce que la vidéo permet d'obtenir, puis vous revenez en arrière. C'est l'un des angles que nous détaillons dans sept façons de capter l'attention dès les trois premières secondes, et il fonctionne particulièrement bien pour les tutoriels, où le résultat se voit.
Le corps : des blocs autonomes, pas un fleuve
Le défaut le plus courant d'un corps de script est d'être écrit d'un trait, comme un article lu à voix haute. Le spectateur n'a alors aucun point d'accroche : il ne sait pas où il en est, ni combien il en reste. Découpez en trois à cinq blocs, un message par bloc, et le problème disparaît presque entièrement.
Chaque bloc suit la même petite mécanique : une question qui l'ouvre, une démonstration qui y répond, une transition qui annonce le suivant. La transition est la pièce que tout le monde oublie, et c'est pourtant elle qui tient la fidélisation. « Ça, c'était la partie facile. La suivante coûte beaucoup plus cher à corriger » relance mieux que n'importe quel effet de montage.
- Un message par bloc. Si vous devez écrire « et aussi », c'est qu'il y a deux blocs.
- Une question en ouverture. Elle donne au spectateur une raison de rester encore quarante secondes.
- Une démonstration, jamais une définition seule. Montrez l'écran, l'objet, l'avant et l'après.
- Une transition qui promet. Elle annonce le bloc suivant en termes de bénéfice, pas de numéro.
- Un ordre assumé. Le bloc le plus fort en premier si votre audience est froide, en dernier si elle vous connaît déjà.
L'appel à l'action : une seule demande à la fois
Un appel à l'action empilé ne vaut rien. « Abonnez-vous, likez, commentez, activez la cloche et allez voir mon autre vidéo » demande cinq choses, donc n'en obtient aucune. Choisissez la seule action qui compte pour cette vidéo, et formulez-la en bénéfice pour le spectateur, pas en service rendu à vous. Nous avons rassemblé vingt et une formules d'appel à l'action qui font cliquer sans supplier pour ceux qui bloquent sur la formulation.
Le placement compte autant que la phrase. D'après l'aide YouTube, un écran de fin ne peut occuper que les vingt dernières secondes d'une vidéo, et celle-ci doit durer au moins vingt-cinq secondes pour en accueillir un. Écrivez donc votre dernière phrase en sachant qu'un élément cliquable sera affiché pendant qu'elle est prononcée. Nommez la vidéo suivante à voix haute plutôt que de dire « la vidéo qui s'affiche ici » : la part de votre audience qui écoute sans regarder ne saurait pas de quoi vous parlez.
Exemple complet : le script d'une vidéo de trois minutes
Voici le modèle appliqué de bout en bout. Sujet : « Trois erreurs qui font rater vos miniatures YouTube ». Durée visée : trois minutes, soit environ 450 mots de narration. Le budget se répartit ainsi, une quarantaine de mots pour le hook, trois blocs d'environ 120 mots, une cinquantaine de mots pour l'appel à l'action. Le script ci-dessous est écrit tel qu'il serait lu, ponctuation comprise.

Le hook, écrit en entier (0:00 à 0:16)
Votre miniature est belle sur votre écran, et invisible dans le fil. Trois erreurs expliquent la plupart des cas, et je les ai faites toutes les trois. À la fin de cette vidéo, vous saurez les repérer en dix secondes sur vos propres miniatures. Première erreur, tout de suite.
Quatre gestes en quatre phrases : le problème, la preuve glissée sans se vanter, la promesse datée à la fin de la vidéo, le plan réduit à sa plus simple expression. Aucune présentation, aucun générique, aucun remerciement. Le générique de la chaîne, s'il existe, se place juste après cette dernière phrase.
Bloc 1, le texte trop long (0:16 à 1:04)
Première erreur : trop de texte. Vous écrivez une phrase entière sur la miniature, et elle est parfaitement lisible sur votre écran d'ordinateur. Sauf que personne ne la verra à cette taille. Sur un téléphone, votre miniature fait à peu près la largeur d'un pouce. Regardez ce que devient cette phrase de sept mots quand je la réduis à la taille réelle. Illisible. Trois mots, c'est le maximum, quatre si les mots sont courts. Le test tient en une manipulation : réduisez votre miniature à la taille d'une vignette, posez-la au milieu d'une capture de la page d'accueil, et reculez d'un mètre. Si vous ne lisez pas votre propre texte, votre spectateur ne le lira pas non plus. Ce test dure trente secondes. La deuxième erreur, elle, se voit encore plus souvent.
Bloc 2, le contraste absent (1:04 à 1:52)
Deuxième erreur : le manque de contraste. Un texte blanc posé sur un ciel clair disparaît. Un texte rouge sur un fond violet vibre et fatigue l'oeil. Le fil de YouTube n'est jamais neutre : votre miniature se retrouve entourée d'autres miniatures, chacune criant un peu plus fort que la précédente. Ce qui vous sauve n'est pas une couleur à la mode, c'est un écart. Texte très clair sur zone très sombre, ou l'inverse. Rien entre les deux. Regardez ces deux versions côte à côte : même image, même texte, seule la zone sous les lettres a été assombrie. La deuxième se lit à un mètre, la première non. Et vous n'avez besoin d'aucun logiciel compliqué : un rectangle sombre posé sous le texte suffit. Reste la troisième erreur, la plus coûteuse des trois.
Bloc 3, la miniature qui répète le titre (1:52 à 2:38)
Troisième erreur : la miniature qui répète le titre. Votre titre annonce « Trois erreurs de miniature », et votre miniature affiche « Trois erreurs de miniature ». Vous venez d'utiliser deux fois le même espace pour dire une seule chose. Le titre et la miniature forment une phrase à deux voix : l'un pose le sujet, l'autre montre l'enjeu. Si le titre dit « Trois erreurs », la miniature montre la miniature ratée, une croix rouge, et un seul mot. Le spectateur assemble les deux tout seul, et c'est cet assemblage qui déclenche le clic. Faites le test sur vos dix dernières vidéos, et comptez combien de fois vous avez dit deux fois la même chose.
L'appel à l'action, écrit en entier (2:38 à 3:00)
Vous avez les trois erreurs et le test de la vignette réduite. Prenez votre dernière miniature, posez-lui les trois questions, et corrigez celle qui coince. Et si vous voulez voir ces règles appliquées par des gens dont c'est le métier, j'ai décortiqué onze miniatures de grandes chaînes dans « Onze miniatures au microscope », juste ici.
Une seule demande, formulée comme un service rendu au spectateur, et la vidéo suivante nommée à voix haute. Aucune mention de l'abonnement : sur une vidéo de trois minutes destinée à un public froid, ce serait la moins probable des trois demandes possibles. Vous pouvez évidemment la placer, à condition de retirer autre chose. Si vous voulez comparer ce squelette à d'autres formats, sept scripts complets prêts à copier déroulent le même exercice pour une publicité, un tutoriel et une vidéo de vente.
Caler la longueur du script sur la durée visée
Le calcul est simple et il varie peu : sur nos générations de voix off, une minute de narration en français représente environ 150 mots. Une vidéo de trois minutes demande donc à peu près 450 mots, une vidéo de dix minutes environ 1 500 mots. Raisonnez toujours en minutes, jamais en pages : une page de traitement de texte ne dit rien de la durée réelle une fois lue à voix haute. Le détail du calcul, selon un débit lent, normal ou rapide, est repris dans notre calcul du nombre de mots pour une minute de vidéo.
Une fois la durée fixée, pensez aux chapitres. L'aide YouTube précise qu'une vidéo doit contenir au moins trois horodatages pour que les chapitres s'activent, que le premier doit commencer à 00:00, et que chaque chapitre doit durer au moins dix secondes. Si vous avez écrit trois à cinq blocs, vos chapitres sont déjà écrits : ce sont vos titres de blocs. Le découpage du script devient celui de la barre de lecture, et le spectateur qui cherche une réponse précise la trouve sans repartir.
Écrire ce modèle avec l'IA sans perdre votre voix
Une IA écrit très bien un corps de script : elle structure, elle découpe, elle n'oublie jamais les transitions. Elle est nettement moins bonne sur le hook, parce que le hook demande de connaître le spectateur. La répartition qui marche est donc celle-ci. Vous donnez le sujet, la durée visée et le public ; l'outil produit la charpente et les blocs ; vous réécrivez vous-même les quinze premières secondes et la dernière phrase. C'est la logique du studio que nous avons construit sur easyvids.io, où le script généré alimente ensuite directement les scènes, la voix off et le montage.
Deux consignes améliorent nettement le résultat. Donnez la durée en minutes plutôt qu'en nombre de mots : l'outil calibre alors le texte pour l'oreille, et non pour la page. Et précisez le niveau du public, débutant complet ou praticien confirmé. C'est ce qui décide du nombre de définitions à garder, et c'est de loin la variable qui change le plus le script obtenu.
Les erreurs qui vident la courbe de fidélisation
- Le générique en ouverture. Cinq secondes de logo animé avant le premier mot utile, sur une vidéo qui se joue dans les quinze premières.
- La promesse tenue trop tard. Si le hook promet une méthode et que la méthode arrive à la sixième minute, le spectateur ne sera plus là pour la voir.
- Le corps sans transitions. Les blocs s'enchaînent sans phrase de relance, et chaque frontière devient une sortie possible.
- L'appel à l'action empilé. Quatre demandes en dix secondes valent zéro demande.
- Le script écrit pour l'oeil. Des phrases de quarante mots, des subordonnées, du vocabulaire de rapport. Lisez toujours votre script à voix haute avant de l'enregistrer : ce que vous butez à lire, le spectateur bute à le comprendre.
Questions fréquentes
Quelle longueur pour un script de vidéo YouTube de dix minutes ?
Environ 1 500 mots, sur la base de 150 mots par minute de narration. Retirez une part si votre montage comporte des démonstrations à l'écran pendant lesquelles vous ne parlez pas, ajoutez-en si votre débit est rapide. Le plus sûr reste d'enregistrer une minute de test avec votre propre voix et de compter les mots réellement prononcés.
Faut-il écrire un script YouTube mot à mot ou garder des notes ?
Écrivez mot à mot le hook et l'appel à l'action, gardez des notes pour le corps si vous êtes à l'aise face caméra. Ce sont les deux extrémités qui comptent, et les seules où une hésitation coûte cher. Si vous utilisez une voix off générée, le mot à mot devient obligatoire partout, puisque c'est le texte exact qui sera lu.
Où placer la demande d'abonnement dans un script YouTube ?
Après votre premier vrai apport de valeur, jamais avant, et jamais dans les quinze premières secondes. Le spectateur qui vient de comprendre quelque chose d'utile est le seul à qui la demande semble légitime. Une seule fois par vidéo, en une phrase, sans insister.
L'IA peut-elle écrire un script YouTube complet ?
Oui pour la structure, les blocs et les transitions, à condition de lui donner le sujet, la durée en minutes et le public visé. Non pour le hook, qui repose sur la connaissance concrète de votre audience, et non pour les anecdotes personnelles qui font la différence. Le partage de travail le plus efficace consiste à générer la charpente, puis à réécrire les quinze premières secondes vous-même.
Ce modèle fonctionne-t-il aussi pour les Shorts ?
Le principe reste, les proportions changent. Sur un format vertical de trente secondes, le hook occupe la première seconde et non les quinze premières, le corps se réduit à un seul message, et l'appel à l'action tient souvent à l'écran plutôt qu'à la voix. Écrire un Short avec le budget de mots d'une vidéo longue donne un texte récité trop vite, que personne ne suit.
Reprenez votre prochain sujet et écrivez-le dans cet ordre : les blocs du corps d'abord, l'appel à l'action ensuite, le hook en dernier. Vous verrez tout de suite si la promesse que vous alliez faire correspond à ce que la vidéo donne vraiment. Et si vous voulez que ce script se transforme directement en vidéo, avec les scènes, la voix off et le montage enchaînés, ouvrez un compte gratuit et testez le modèle sur votre prochaine idée.
