Wayback Machine et YouTube : ce qui est gardé et comment le retrouver
La Wayback Machine photographie le web depuis 1996, et les pages YouTube sont entrées dans le cadre avec le reste. Quand une vidéo disparaît, cet instantané est souvent tout ce qu'il en reste. Voici ce que l'archive détient réellement pour une URL YouTube, ce qu'elle n'a jamais eu, et comment y chercher quand le lien s'est perdu.
Ce que contient l'instantané d'une page YouTube
Une capture, c'est le HTML reçu par le robot à un instant précis, pas la vidéo. D'une page sauvegardée on peut généralement récupérer :
- Le titre, tel qu'il était le jour de la capture.
- La description, avec les liens que l'auteur y avait mis.
- La chaîne, son nom et son identifiant, ce qui ouvre la porte à toutes ses autres vidéos.
- La date de mise en ligne, ainsi que les vues et les mentions J'aime figées à cet instant.
- La miniature, enregistrée à part comme fichier image.
- Les sous-titres, quand le robot a aussi ramassé la piste.
Ce sont des métadonnées et non la vidéo, et elles servent plus qu'il n'y paraît : elles identifient la vidéo, prouvent qu'elle a existé, disent de quoi elle parlait, et avec les sous-titres elles conservent souvent ce qui y était dit.
Pourquoi le lecteur de la page archivée reste vide
YouTube n'a jamais servi la vidéo depuis la page que vous consultez. La page contient un lecteur, et c'est lui qui demande le flux aux serveurs de Google via une adresse signée qui expire en quelques heures. Le robot qui sauvegarde la page ne suit pas ce flux, et l'aurait-il suivi que l'adresse serait morte bien avant que quiconque ouvre la copie. D'où une page archivée qui a l'air correcte et ne lit rien.
Le fichier, quand il existe, se trouve sur un autre chemin : l'archive conserve parfois la réponse vidéo brute pour un identifiant donné, et la Wayback Machine sait alors la rejouer. C'est le cas rare, pas le cas normal. Dans les résultats, les vidéos dont le fichier a été gardé portent la mention Fichier vidéo. Voir regarder et télécharger les fichiers archivés.
« We have not been able to archive the video associated with this YouTube page »
Cette phrase en anglais atterrit assez souvent dans les moteurs de recherche pour mériter une réponse nette. Elle signifie que la Wayback Machine a sauvegardé la page et pas la vidéo derrière. Les raisons habituelles : la vidéo avait déjà disparu au moment de la capture, la requête vers le média a été refusée ou a expiré, ou le flux est tout simplement hors de portée du robot.
C'est le compte rendu d'une tentative, pas un verdict sur la vidéo. Que faire ensuite :
- Chercher une capture plus ancienne. Une tentative ratée ne dit rien des instantanés pris des années plus tôt, qui peuvent être antérieurs à la suppression et contenir la page complète.
- Interroger le média directement. Consulter un instantané ne demande pas à l'archive si elle possède le fichier vidéo. Collez le lien ou l'identifiant dans la recherche et nous posons la question pour vous.
- Chercher une copie ailleurs. Ce qui est supprimé est souvent remis en ligne : trouver une réupload.
Chercher quand vous avez encore le lien
Collez l'URL YouTube complète, le lien court youtu.be ou simplement l'identifiant de 11 caractères. Vous obtenez ce que les archives ont gardé : titre, description, miniature, sous-titres, et l'existence ou non d'un fichier vidéo. Pas à pas : retrouver une vidéo supprimée par URL ou identifiant.
Chercher quand le lien manque
C'est là que la Wayback Machine, seule, s'arrête. Son interface répond à une seule question, « avez-vous une capture de cette adresse exacte », il faut donc connaître l'adresse avant de demander. Impossible de lui demander quelles vidéos d'une chaîne elle a sauvegardées, impossible de chercher dans ce qu'elle a sauvegardé.
C'est ce manque que ce site comble. Plus de 1,5 milliard d'identifiants de vidéos issus de la Wayback Machine et de Common Crawl, indexés pour permettre trois autres façons de chercher :
- Par chaîne. Une URL de chaîne, un @handle ou un identifiant renvoient toutes les vidéos que nous connaissons d'elle, supprimées comprises. La voie la plus rapide quand la vidéo a disparu mais pas la chaîne : rechercher par chaîne.
- Par mots. Recherche plein texte sur les titres et descriptions archivés, quand vous ne vous souvenez que du nom : rechercher par titre et description.
- Par ce qui a été dit. Les sous-titres archivés sont aussi indexés, une phrase retenue peut donc retrouver la vidéo.
Le bouton Save Page Now archive-t-il la vidéo ?
Le bouton Save Page Now de web.archive.org sauvegarde la page. Sur une vidéo encore en ligne, il capture parfois aussi le flux, sans aucune garantie et sans signal clair indiquant si cela a marché. À prendre comme une chance, pas comme un plan : si une vidéo compte pour vous, faites votre propre copie tant qu'elle est là. L'archive est une sortie de secours, pas un service de sauvegarde.
Ce que l'archive ne donnera jamais
- Les vidéos que personne n'a explorées. Si la page n'a jamais été capturée avant la suppression, il n'y a rien à récupérer. La couverture suit l'attention : les chaînes populaires et les vidéos liées sont capturées souvent, une vidéo à quarante vues n'a peut-être jamais reçu la visite d'un robot.
- Les vidéos privées ou non répertoriées sans le moindre lien public. Un robot ne sauvegarde pas une page qu'il ne peut pas atteindre.
- La plupart des commentaires. Pendant presque toute l'histoire de YouTube, les commentaires se chargeaient après la page, ils ne sont donc généralement pas dans le HTML sauvegardé.
- Ce que l'archive a retiré à la demande d'un ayant droit.