Веб-архив и YouTube: что там сохраняется и как это найти
Wayback Machine фотографирует интернет с 1996 года, и страницы YouTube попадали в кадр вместе со всем остальным. Когда видео исчезает, такой снимок часто оказывается единственным, что от него осталось. Ниже: что архив действительно хранит по ссылке на YouTube, чего у него не было никогда и как искать в нём, когда самой ссылки у вас уже нет.
Что содержит снимок страницы YouTube
Снимок это HTML, который краулер получил в конкретный момент, а не видео. Из сохранённой страницы обычно удаётся достать:
- Название в том виде, в каком оно было в день съёмки.
- Описание вместе со ссылками, которые автор туда положил.
- Канал, его имя и идентификатор, а это ключ ко всем остальным роликам.
- Дату загрузки, а также просмотры и лайки, застывшие на момент съёмки.
- Обложку, она сохраняется отдельным файлом-картинкой.
- Субтитры, если краулеру заодно достался файл дорожки.
Это метаданные, а не видео, и пользы от них больше, чем кажется: ролик опознаётся, факт его существования доказан, тема ясна, а вместе с субтитрами часто сохраняется и то, что в нём говорили.
Почему плеер на архивной странице пустой
YouTube никогда не отдавал видео с той страницы, которую вы видите. На странице стоит плеер, и уже он просит поток у медиасерверов Google по адресу, который подписан и живёт несколько часов. Краулер, сохраняя страницу, за этим потоком не идёт, а если бы и пошёл, адрес умер бы задолго до того, как снимок кто-то откроет. Поэтому архивная страница выглядит правильно и не играет.
Сам файл, если он вообще есть, лежит на отдельном пути: архив иногда хранит сырой видеоответ для конкретного идентификатора, и тогда Wayback Machine может его проиграть. Это редкий случай, а не обычный. В выдаче такие ролики помечены как Есть видео. Подробнее: как смотреть и скачивать архивные файлы.
«We have not been able to archive the video associated with this YouTube page»
Эту фразу вставляют в поиск достаточно часто, чтобы ответить на неё прямо. Она означает, что Wayback Machine сохранил страницу и не сохранил видео за ней. Обычные причины: ролика уже не было в момент съёмки, запрос за медиа был отклонён или отвалился по таймауту, либо поток краулеру просто недоступен.
Это отчёт об одной попытке, а не приговор ролику. Что делать дальше:
- Искать снимок постарше. Неудачная попытка ничего не говорит о снимках, сделанных годами раньше, а те могут быть сняты до удаления и содержать полную страницу.
- Спросить про медиа напрямую. Просмотр снимка не спрашивает архив, есть ли у него файл. Вставьте ссылку или идентификатор ролика в поиск, и конвейер спросит за вас.
- Поискать копию в другом месте. Удалённое часто перезаливают: как искать перезалив.
Поиск, когда ссылка у вас есть
Вставьте полную ссылку YouTube, короткую youtu.be или голый идентификатор из 11 символов. Вы получите всё, что сохранили архивы: название, описание, обложку, субтитры и признак наличия видеофайла. По шагам: найти удалённое видео по ссылке или ID.
Поиск, когда ссылки нет
Здесь Wayback Machine сам по себе заканчивается. Его интерфейс отвечает на один вопрос, «есть ли у вас снимок вот этого адреса», то есть адрес нужно знать заранее. Спросить его, какие ролики канала он сохранил, нельзя, и искать внутри сохранённого тоже нельзя.
Эту дыру и закрывает наш сайт. Более 1,5 миллиарда идентификаторов видео из Wayback Machine и Common Crawl проиндексированы так, что искать можно ещё тремя способами:
- По каналу. Ссылка на канал, @хендл или идентификатор канала вернут все известные нам ролики, включая удалённые. Это самый быстрый путь, когда видео уже нет, а канал ещё есть: поиск по каналу.
- По словам. Полнотекстовый поиск по архивным названиям и описаниям, когда помните, как ролик назывался, и больше ничего: поиск по названию и описанию.
- По сказанному. Архивные субтитры тоже в индексе, так что запомнившаяся фраза из ролика способна его найти.
Сохраняет ли кнопка Save Page Now само видео
Кнопка Save Page Now на web.archive.org сохраняет страницу. Для ещё живого ролика она иногда захватывает и поток, без всяких гарантий и без внятного сигнала, получилось ли. Считайте это лотереей, а не планом: если ролик вам дорог, сделайте свою копию, пока он на месте. Архив это пожарная лестница, а не резервное копирование.
Чего в архиве не будет никогда
- Роликов, которых никто не обошёл. Если страницу не сняли до удаления, восстанавливать нечего. Покрытие идёт за вниманием: популярные каналы и зацитированные ролики снимают часто, а к видео с сорока просмотрами краулер мог не зайти ни разу.
- Приватных и скрытых по ссылке роликов, на которые не вело ни одной публичной ссылки. Краулер не сохранит страницу, до которой не может дойти.
- Большинства комментариев. Почти всю историю YouTube комментарии подгружались уже после страницы, поэтому в сохранённом HTML их обычно нет.
- Того, что архив удалил по требованию правообладателя.