Нейросеть Яндекса для поиска по архивам: как найти предков и исторические документы

Узнайте, как работает Яндекс Поиск по архивам на базе нейросетей: какие документы доступны, как искать предков, использовать фильтры и операторы, а также о точности распознавания и ограничениях сервиса.

Что такое Яндекс Поиск по архивам и зачем он нужен

Яндекс Поиск по архивам — это специализированный сервис, который позволяет искать информацию в оцифрованных исторических документах, хранящихся в государственных архивах России. Главная особенность — использование нейросетей для распознавания рукописного текста XVIII–XX веков, который часто трудно прочитать даже trained eye. Сервис ориентирован на генеалогов, краеведов, историков и всех, кто хочет найти сведения о своих предках или изучить историю населённого пункта.

В отличие от обычного поиска, здесь можно работать с метрическими книгами, исповедными ведомостями, ревизскими сказками, а также с дореволюционными и советскими газетами. Нейросеть не только распознаёт символы, но и структурирует информацию, выделяя имена, даты и роли участников событий. Это делает поиск значительно быстрее и точнее, чем ручной просмотр архивных дел.

Какие документы доступны в базе сервиса

База сервиса включает несколько типов материалов. Основу составляют архивные документы:

  • Метрические книги — записи о рождениях, браках и смертях, которые велись церковными приходами. Это ключевой источник для генеалогического поиска.
  • Исповедные ведомости — списки прихожан, посещавших исповедь, с указанием возраста и семейного положения.
  • Ревизские сказки — результаты переписей податного населения, проводившихся в Российской империи.

Кроме того, в базе есть периодические издания (газеты и журналы) с середины XIX века до начала XXI века, а также справочники. По данным на 2026 год, объём базы составляет около 22 миллионов листов архивных документов и примерно 6 миллионов страниц периодики. География источников широкая: Москва, Московская область, Оренбургская, Вологодская, Иркутская, Астраханская области, Великий Новгород, Республика Мордовия и другие регионы. Список архивов постоянно расширяется.

Как работает нейросеть: технология распознавания и структурирования

В основе сервиса лежит технология оптического распознавания текста (OCR), адаптированная для исторических документов. Нейросеть обучалась на образцах дореформенной орфографии, рукописных почерков и типографских шрифтов XIX века. Она способна распознавать утратившие актуальность буквы, например «ѣ» (ять) и «ѳ» (фита), и корректно преобразовывать их в современный текст.

С 2026 года сервис использует мультимодальную модель Alice AI VLM, которая не только распознаёт текст, но и анализирует структуру документа. Модель определяет, кто является родителем, женихом, невестой или свидетелем в записи, и устанавливает связи между людьми. Это позволяет пользователям фильтровать результаты по ролям, например искать только записи, где человек указан как отец. Точность распознавания оценивается в среднем в 90,5%, при этом для записей о рождении она достигает 92,7%, для браков — 89,7%, для смертей — 87,2%.

Как искать: основные принципы и операторы

Поиск по архивам работает аналогично обычному поиску Яндекса. Можно вводить запросы как в современной орфографии, так и в дореформенной — система автоматически сопоставляет варианты. Например, запрос «Тимофей Михеев» найдёт запись с написанием «Тимоѳей Михѣевъ».

По умолчанию поиск учитывает все словоформы (падежи, числа, склонения), но не однокоренные слова. Для уточнения запроса доступны операторы:

  • !слово — поиск в точной форме (например, !романовых).
  • -слово — исключение слова (например, романов -михаил).
  • слово1 | слово2 — поиск любого из слов.
  • "фраза" — поиск точной цитаты.
  • "слово * слово" — цитата с пропущенным словом.

Эти операторы помогают сузить результаты и избежать ложных совпадений. Например, если вы ищете фамилию «Романов», но не хотите видеть упоминания о царе Михаиле, можно использовать исключающий оператор.

Фильтры для архивных документов: как сузить область поиска

Для архивных документов доступны фильтры, которые позволяют ограничить поиск по нескольким параметрам:

  • Крайние даты дел — укажите период, например 1850–1870 годы.
  • Архив, фонд, опись, дело — можно выбрать конкретное хранилище и единицу хранения. Фильтры появляются последовательно: сначала архив, затем фонд и так далее. Если выбрать несколько архивов, фильтры по фонду и описи станут недоступны.
  • Тип события — рождения, браки, смерти.
  • Категория участников — например, для рождения можно выбрать «родившийся», «отец», «мать», «восприемники».
  • Тип документа — метрические книги, ревизские сказки, исповедные ведомости.
  • Область поиска — только заголовок или весь текст документа.

Дополнительные настройки позволяют скрывать дела без сканов, показывать только недавно добавленные документы или исключать уже просмотренные. Важно учитывать, что фильтр «Тип события и участники» работает только для метрических книг, и при его использовании фильтры «Тип документа» и «Область поиска» становятся недоступны.

Фильтры для периодики и справочников

Для газет, журналов и справочников предусмотрены отдельные фильтры. Можно ограничить поиск по:

  • Дате выхода — для периодики указываются точные даты, для справочников — годы.
  • Названию издания — например, «Московские ведомости».
  • Региону издания — если важно найти местную прессу.
  • Типу издания — газета, журнал, справочник.

Эти фильтры особенно полезны для краеведческих исследований, когда нужно найти публикации о конкретном событии или человеке в определённый период. Например, можно найти объявление о розыске родственников или статью о знаменитом земляке.

Работа с документом: режимы просмотра и расшифровка

После того как документ найден, его можно открыть в режиме предпросмотра прямо на странице результатов. Это позволяет быстро оценить, подходит ли запись. Для детального изучения нужно нажать «Подробнее» — документ откроется в режиме чтения, где доступны:

  • Изменение масштаба и разворот на весь экран.
  • Настройка отображения расшифровки: блоками или построчно.
  • Синхронизация между изображением и текстом: при клике на строку в расшифровке подсвечивается соответствующий фрагмент на скане и наоборот.
  • Переход к нужной странице с помощью стрелок или ввода номера.

Расшифровку можно скрыть, чтобы рассматривать оригинал, или использовать подсветку для поиска нужных слов. Также документы можно добавлять в раздел «Избранное» и присваивать им метки, чтобы упростить повторный доступ. Метки видны только вам и помогают организовать исследование.

Карта и административно-территориальное деление

Сервис включает интерактивную карту, которая отображает границы административно-территориального деления на 1897 год. Это помогает определить, к какой губернии и уезду относился населённый пункт в прошлом, что критично для поиска в архивах, так как границы менялись.

На карте зелёными точками отмечены населённые пункты, по которым в базе есть метрические книги. Можно выбрать губернию, уезд или конкретное село, а затем нажать «Искать здесь», чтобы задать поисковый запрос с фильтром по этой территории. Также можно просмотреть список всех метрических книг по выбранному приходу. Поиск населённого пункта осуществляется по современному названию через строку поиска в верхнем левом углу карты.

Ограничения и советы по эффективному поиску

Несмотря на мощь нейросетей, сервис имеет ограничения. Большинство документов датируются XVIII — началом XX века, поэтому искать людей, родившихся менее 100 лет назад, бессмысленно. Если человек не найден, возможно, документы ещё не оцифрованы или не переданы в сервис. В этом случае стоит вернуться позже, так как база постоянно пополняется.

Также важно учитывать особенности исторической орфографии: отчества часто заканчивались на «-ов» (например, «Иванов Иван Максимов» вместо «Максимович»). Если результатов слишком много, добавьте больше слов или используйте фильтры; если слишком мало — уберите часть слов или попробуйте альтернативные написания. Ошибки в расшифровке возможны, особенно для сложных почерков, поэтому при важных находках рекомендуется сверяться со сканом оригинала.

Перспективы развития и сотрудничество с архивами

Яндекс активно расширяет партнёрство с государственными архивами, музеями и библиотеками. Участие в проекте бесплатное для архивов: компания берёт на себя расходы на обработку и размещение, кроме сканирования. Приоритетными материалами являются метрические книги, ревизские сказки, исповедные ведомости, а также старинные книги и газеты.

Если нужного архива нет в каталоге, пользователи могут обратиться в региональную администрацию или в Администрацию Президента с просьбой о сотрудничестве. Это подчёркивает важность общественного интереса для развития сервиса. В будущем можно ожидать увеличения числа оцифрованных документов и улучшения качества распознавания, что сделает генеалогические исследования ещё доступнее.

Вопросы и ответы

Как найти предка, если я знаю только фамилию и примерный год рождения?

Начните с запроса, содержащего фамилию и населённый пункт, если он известен. Например, «Некрасов деревня Ступино». Используйте фильтры по типу события (рождение, брак, смерть) и датам. Если результатов слишком много, добавьте имя или отчество. Помните, что в документах XVIII–XIX веков отчества часто писались в краткой форме (Иванов Иван Максимов вместо Максимович). Если ничего не найдено, попробуйте альтернативные написания фамилии или вернитесь позже — база пополняется.

Можно ли загрузить свой документ для распознавания?

Нет, сервис не поддерживает загрузку личных документов. Он работает только с материалами государственных архивов, которые передаются в рамках официального сотрудничества. Если вам нужно расшифровать собственный документ, обратитесь к частным специалистам по генеалогии или палеографии.

Почему в результатах поиска есть ошибки в именах и датах?

Распознавание рукописного текста — сложная задача, и нейросеть может ошибаться, особенно на неразборчивых почерках. Ошибки в названиях дел и датах могут быть связаны с архивными описями, которые заполнялись вручную. Если вы заметили неточность, сообщите в службу поддержки сервиса. Разработчики регулярно улучшают алгоритмы, поэтому качество со временем растёт.

Какие операторы поиска поддерживает сервис?

Поддерживаются стандартные операторы Яндекса: ! для точной формы слова, - для исключения, | для логического «или», кавычки для точной цитаты и * для пропущенного слова в цитате. Например, запрос !романовых найдёт только форму «Романовых», а романов -михаил исключит упоминания с именем Михаил.

Как использовать карту для поиска метрических книг?

Откройте карту в сервисе, приблизьте нужный регион. Зелёные точки обозначают населённые пункты, для которых есть метрические книги. Нажмите на точку, затем выберите «Искать здесь», чтобы задать поисковый запрос с фильтром по этому месту. Также можно выбрать губернию или уезд через селектор под картой и нажать «Документы», чтобы увидеть список всех книг по приходу.

Что делать, если нужного архива нет в списке?

Если архив не представлен в сервисе, вы можете обратиться в организацию, которая им управляет: для региональных архивов — в администрацию региона, для федеральных — в Администрацию Президента. Общественный интерес может стимулировать оцифровку и передачу документов. Также следите за обновлениями сервиса — список архивов постоянно расширяется.