Веб-архив и YouTube: что там сохраняется и как это найти

Wayback Machine фотографирует интернет с 1996 года, и страницы YouTube попадали в кадр вместе со всем остальным. Когда видео исчезает, такой снимок часто оказывается единственным, что от него осталось. Ниже: что архив действительно хранит по ссылке на YouTube, чего у него не было никогда и как искать в нём, когда самой ссылки у вас уже нет.

Что содержит снимок страницы YouTube

Снимок это HTML, который краулер получил в конкретный момент, а не видео. Из сохранённой страницы обычно удаётся достать:

Это метаданные, а не видео, и пользы от них больше, чем кажется: ролик опознаётся, факт его существования доказан, тема ясна, а вместе с субтитрами часто сохраняется и то, что в нём говорили.

Почему плеер на архивной странице пустой

YouTube никогда не отдавал видео с той страницы, которую вы видите. На странице стоит плеер, и уже он просит поток у медиасерверов Google по адресу, который подписан и живёт несколько часов. Краулер, сохраняя страницу, за этим потоком не идёт, а если бы и пошёл, адрес умер бы задолго до того, как снимок кто-то откроет. Поэтому архивная страница выглядит правильно и не играет.

Сам файл, если он вообще есть, лежит на отдельном пути: архив иногда хранит сырой видеоответ для конкретного идентификатора, и тогда Wayback Machine может его проиграть. Это редкий случай, а не обычный. В выдаче такие ролики помечены как Есть видео. Подробнее: как смотреть и скачивать архивные файлы.

«We have not been able to archive the video associated with this YouTube page»

Эту фразу вставляют в поиск достаточно часто, чтобы ответить на неё прямо. Она означает, что Wayback Machine сохранил страницу и не сохранил видео за ней. Обычные причины: ролика уже не было в момент съёмки, запрос за медиа был отклонён или отвалился по таймауту, либо поток краулеру просто недоступен.

Это отчёт об одной попытке, а не приговор ролику. Что делать дальше:

Поиск, когда ссылка у вас есть

Вставьте полную ссылку YouTube, короткую youtu.be или голый идентификатор из 11 символов. Вы получите всё, что сохранили архивы: название, описание, обложку, субтитры и признак наличия видеофайла. По шагам: найти удалённое видео по ссылке или ID.

Поиск, когда ссылки нет

Здесь Wayback Machine сам по себе заканчивается. Его интерфейс отвечает на один вопрос, «есть ли у вас снимок вот этого адреса», то есть адрес нужно знать заранее. Спросить его, какие ролики канала он сохранил, нельзя, и искать внутри сохранённого тоже нельзя.

Эту дыру и закрывает наш сайт. Более 1,5 миллиарда идентификаторов видео из Wayback Machine и Common Crawl проиндексированы так, что искать можно ещё тремя способами:

Если знаете канал, начинайте с него. Поиск по каналу возвращает весь список разом, а узнать удалённый ролик в списке гораздо проще, чем восстанавливать его ссылку по памяти.

Сохраняет ли кнопка Save Page Now само видео

Кнопка Save Page Now на web.archive.org сохраняет страницу. Для ещё живого ролика она иногда захватывает и поток, без всяких гарантий и без внятного сигнала, получилось ли. Считайте это лотереей, а не планом: если ролик вам дорог, сделайте свою копию, пока он на месте. Архив это пожарная лестница, а не резервное копирование.

Чего в архиве не будет никогда

← Вернуться к оглавлению