Предварительное автоматическое распознавание текста

(редакция от 10.09.2026)

Для многих машинописных описей выполнено предварительное автоматическое распознавание текста (OCR). При работе с такими описями между формой ввода заголовка и основной таблицей появляется дополнительная панель "Предварительно распознанный текст" (в вертикальном режиме экрана - справа сверху). Она содержит либо желтое текстовое поле с распознанными заголовками, либо таблицу с предварительными данными, а внизу - кнопки "Добавить распознанные заголовки" и "Сбросить изменения". Для внутренних описей появляется еще одна кнопка, "Добавить распознанные заголовки как документы": она трактует данные как описания документов внутри дела, а не самих дел.

Смысл работы всегда один: сначала привести данные в панели в полное соответствие со сканом (вычитать, исправить, дочистить), затем нажать кнопку добавления - строки попадут в основную таблицу набранного, где останется доввести недостающее.

Тем, кому удобнее набирать "с нуля", панель можно свернуть (стрелка в её шапке), чтобы она не занимала место на экране.

Все правки в панели (и в текстовом поле, и в таблице) автоматически сохраняются локально в вашем браузере отдельно для каждой страницы описи: можно листать страницы и возвращаться - правки не потеряются. Но на другом компьютере или после чистки данных браузера их не будет. Кнопка "Сбросить изменения" возвращает исходный распознанный текст текущей страницы.

Как узнать, есть ли у описи распознавание

В разделе "Задания" (а также в окнах корректуры и курации) в списке описей рядом с названием описи выводятся значки сервиса, которым выполнено предварительное распознавание:

  • Родотека - зеленый квадратик с буквой "Р" - распознавание выполнено сервисом "Родотека";
  • Генотек - бирюзовый квадратик с эмблемой ДНК - распознавание выполнено сервисом "Генотек".

При наведении курсора на значок появляется подсказка. Если значка нет - готового распознавания у описи нет, и панель предварительно распознанного текста будет пустой (но ею всё равно можно пользоваться для пакетного ввода заголовков - см. отдельный раздел).

Режимы панели и переключение

Существует три варианта распознавания описи:

  • только заголовки - текстовый режим (желтое поле);
  • вся таблица - табличный режим (номера, заголовки, даты, листаж и т.д. уже разложены по столбцам);
  • таблица с разметкой на образе - самый новый режим: поверх скана рисуется красная сетка таблицы, которую можно править, а данные извлекаются в панель по этой сетке (см. раздел "Разметка таблицы на образе" ниже).

Кнопка с круговыми стрелочками в шапке панели открывает меню, где можно вручную переключиться между текстовым и табличным режимами отображения. Если опись распознана таблицей, но в номерах и датах слишком много мусора, часто быстрее переключиться в текстовый режим и работать только с заголовками.

Текстовый режим (только заголовки)

В большом текстовом поле перечислены заголовки, разделенные пустыми строками. Их нужно очистить от мусора и привести в соответствие с описью прямо в поле, затем нажать "Добавить распознанные заголовки": каждый блок текста (между пустыми строками) станет отдельной строкой основной таблицы. После этого - доввести значения остальных полей, редактируя строки в таблице. В текстовом поле работает и голосовой ввод (значок микрофона, ALT+R).

Если перед нажатием кнопки заполнить в форме ввода сверху поля "Раздел", "Год (раздел)", "Связка" и "Порядковый №" (под первый из заголовков), эти данные будут учтены при добавлении, а порядковые номера проставятся автоматически по возрастанию.

Текстовый режим панели предварительного распознавания Текстовый режим: в желтом поле - распознанные заголовки, разделенные пустыми строками; справа - скан для сверки.

Табличный режим

Таблица панели повторяет состав столбцов вашей описи. Её нужно вычитать, очистить от мусора и дозаполнить, затем нажать "Добавить распознанные заголовки". Флажки (Выбыло, ОЦ, СФ, ФП, МФ, Оцифровано, Рассекречено) отмечаются прямо в таблице панели галочками (клик по ячейке) и переносятся в основную таблицу по каждой строке. Поля "Раздел", "Год (раздел)", "Связка", а также "Делопр. №", "Старый №" и "Примечание", заполненные в форме ввода сверху, при добавлении применяются ко всем добавляемым строкам.

Табличный режим панели предварительного распознавания Табличный режим: распознанные данные уже разложены по столбцам, каждую строку сверяем со сканом справа.

Приёмы редактирования:

  • Редактирование ячейки - по клику. В узких столбцах редактор при необходимости расширяется, чтобы был виден весь текст (как в Google Sheets); ENTER там завершает ввод. В столбце "Заголовок" ENTER переводит курсор на новую строку, а завершить редактирование можно щелчком по другой ячейке или клавишей TAB.
  • Строки с ошибками (неправильный формат даты, номера и т.п.) подсвечиваются розовым. При нажатии кнопки добавления выполняется полная проверка, и выводится список вида "Строка N: описание ошибки" - пока ошибки не исправлены, строки не добавятся.
  • Если распознавание перепутало местами значения двух столбцов (например, начальную и конечную даты), выделите мышью ячейки в двух соседних столбцах (протянув выделение по нужным строкам) и выберите в контекстном меню "Поменять значения ячеек местами между столбцами".

Контекстное меню (правая кнопка мыши по таблице панели) содержит также: поиск и замену (окно "Найти/Заменить" - как в основной таблице), подменю "Функции" (нормализация регистра, пробелы после №, удаление лишних точек, перенумерация, массовые отметки ОЦ/выбытия), вставку пустых строк выше/ниже, удаление выбранных строк и пункт "Исправить" с подсказками для слов, подчеркнутых проверкой орфографии.

Разметка таблицы на образе (новый режим)

В этом режиме под просмотрщиком образов появляется дополнительная панель с кнопками "Извлечь данные" и "Сбросить сетку таблицы", а поверх скана рисуется красная сетка: рамка таблицы и линии, делящие её на столбцы и строки. Над сеткой показаны названия столбцов ("Порядк. №", "Заголовок", "Даты" и т.д.). Система размечает страницу автоматически, но авторазметка не идеальна - ваша задача её поправить, чтобы линии сетки совпали с реальными границами ячеек таблицы в описи, и нажать "Извлечь данные": распознанный текст будет разложен по ячейкам согласно сетке и попадет в таблицу панели предварительного распознавания, откуда добавляется как обычно. При перелистывании на страницу, для которой панель ещё пуста, извлечение выполняется автоматически.

Разметка таблицы на образе: красная сетка и названия столбцов Разметка на образе: красная сетка с ручками-кружками, названия столбцов над таблицей, извлеченные данные - в панели слева, кнопки "Извлечь данные" и "Сбросить сетку таблицы" - под просмотрщиком.

Вся правка сетки выполняется ПРАВОЙ кнопкой мыши (левая занята обычными действиями просмотрщика):

  • Передвинуть линию - навести курсор (линия подсветится) и перетащить правой кнопкой. Так же двигаются рамка (за стороны и углы) и концы линий (кружки-ручки).
  • Добавить линию: CTRL + правая кнопка - горизонтальная линия через точку клика; ALT + правая кнопка - вертикальная линия через точку клика. Можно и просто протянуть линию правой кнопкой внутри рамки от одного края до противоположного.
  • Удалить линию - навести курсор на линию (она подсветится) и нажать Delete или D (работает в любой раскладке клавиатуры).
  • Нарисовать рамку заново - если рамки нет (после удаления), обвести таблицу протяжкой правой кнопкой.
  • Повернуть всю сетку - навести курсор чуть за угол рамки (появится курсор поворота) и вращать, удерживая правую кнопку. Удобно, когда таблица на скане сфотографирована с наклоном.

На Mac клавиша Ctrl занята системой (Ctrl+клик = правый клик), поэтому модификаторы другие: где выше указано CTRL + правая кнопка - нажимайте ⌘Cmd + правая кнопка, а где ALT + правая кнопка - Control + правая кнопка.

Работа со столбцами (названия над сеткой):

  • Клик по названию столбца открывает меню. Пункт "Пропуск" исключает столбец из извлечения (например, если в бумажной таблице есть столбец, которого нет в описи на сайте) - последующие названия сдвигаются вправо; "Убрать пропуск" возвращает как было.
  • Для столбцов дат в том же меню выбирается режим "Одна дата" (в бумажной таблице обе даты в одном столбце) или "Две даты" (отдельные столбцы начальной и конечной даты).
  • Название столбца можно перетащить мышью на другое место, если порядок столбцов в бумажной таблице отличается.

Настроенная сетка запоминается в браузере для каждой страницы, а состав и порядок столбцов - для описи в целом (на страницах без своей сетки структура столбцов конструируется по вашей настройке автоматически). Кнопка "Сбросить сетку таблицы" возвращает авторазметку текущей страницы.

При извлечении система автоматически чистит данные: исправляет типовые ошибки распознавания цифр и букв, склеивает переносы слов, приводит даты к формату ДД.ММ.ГГГГ (в том числе с римскими месяцами и месяцами словами; диапазон раскладывается в начальную и конечную даты), отбрасывает шапку таблицы и номера страниц, восстанавливает пропущенные порядковые номера по последовательности, а строку, в которой заполнен только заголовок, считает названием раздела и проставляет его в последующие строки (год - в "Раздел (год)", текст - в "Раздел"). Годы от сотворения мира (например, /7191г./) выносятся в "Датировку". Вся эта автоматика может ошибаться - результат обязательно вычитывается по скану, ячейка за ячейкой!

Редактор разметки работает только в современных браузерах; в устаревших (например, Firefox 52) выводится предупреждение - обновите браузер.

Достраивание номеров и разделов, порядок извлечения

В меню "Настройки" (под просмотрщиком, рядом с "Извлечь данные") есть две галочки, включённые по умолчанию. Обе достраивают только пустые ячейки - то, что уже распознано на странице, не меняется. Настройки запоминаются для вашего браузера.

  • "Достраивать номера" - восстанавливает пропущенные порядковые номера дел по последовательности распознанных на странице (заполняет пропуски и исправляет явные выбросы). Если на странице не распознан ни один номер, нумерация продолжается с предыдущей уже извлечённой страницы (а если предыдущей нет - отсчитывается назад от следующей).
  • "Достраивать разделы" - переносит раздел и год-раздел (например, "1813 г.") с предыдущей уже извлечённой страницы в начальные строки текущей - до тех пор, пока на странице не встретится её собственный раздел.

Извлекайте страницы по порядку, одну за другой. Достраивание номеров и разделов смотрит на предыдущую страницу, которую вы уже извлекли, поэтому продолжение нумерации и перенос разделов работают только если предыдущая страница обработана раньше. Если извлекать вразнобой, переносить будет не с чего.

Отсюда удобный приём: задайте (или поправьте) раздел на первой странице - и, пока вы извлекаете остальные страницы по порядку, он будет автоматически копироваться на следующие, пока в описи не начнётся новый раздел.

При добавлении строк кнопкой "Добавить распознанные заголовки" приоритет у значений формы "Добавление" (слева вверху: Раздел, Год (раздел), Делопр. №, Примечание, Связка, флаги и т.д.): если поле формы заполнено, оно перекрывает соответствующий столбец распознанной таблицы у всех добавляемых строк; если поле формы пустое - берётся значение из таблицы. Так через форму удобно проставить одно и то же значение сразу на все строки, а точечные отличия оставить в таблице.

Видео демонстрация

На YouTube: открыть видео в новой вкладке (откроется на сайте видеохостинга).

На RuTube:

Пакетный ввод заголовков без распознавания (в т.ч. голосом)

Панель с текстовым полем доступна во всех заданиях по описям - даже там, где готового распознавания нет (в этом случае она называется "Пакетный ввод заголовков" и по умолчанию свернута; разверните её стрелкой в шапке). Это удобный способ быстро внести сразу много заголовков:

  1. Разверните панель и установите курсор в текстовое поле.
  2. Надиктуйте заголовки через голосовой ввод (значок микрофона в поле или ALT+R) либо наберите/вставьте их текстом. Каждый заголовок отделяйте от следующего пустой строкой (двойной ENTER).
  3. При необходимости заполните в форме ввода сверху поля "Раздел", "Год (раздел)", "Связка" и "Порядковый №" (под первый из заголовков).
  4. Нажмите "Добавить распознанные заголовки" - все заголовки разом станут строками основной таблицы, а порядковые номера проставятся автоматически.

Как и распознанный текст, надиктованный черновик сохраняется локально в браузере отдельно для каждой страницы описи - можно листать страницы и возвращаться к черновику.

Пакетный ввод заголовков: идет голосовой ввод Пакетный ввод: идет диктовка (поле обведено красной рамкой, значок микрофона красный), заголовки разделены пустыми строками; ниже - уже добавленные из этого поля записи.

Персональное ИИ-распознавание

Если у описи нет готового распознавания (или его качество не устраивает), задание можно распознать самостоятельно через современные нейросети. Поддерживаются пять сервисов: Claude (Anthropic), ChatGPT (OpenAI), Gemini (Google), Яндекс (AI Studio) и GigaChat (Сбер). Такое распознавание - персональное: его результат виден только вам и накладывается поверх общего (Родотека/Генотек), не затрагивая работу других волонтеров.

Распознавание выполняется вашим личным API-ключом выбранного сервиса и оплачивается на его стороне по его тарифам (перед запуском система показывает прогноз стоимости - обычно это единицы центов или рублей за задание). У зарубежных сервисов оплата в долларах (нужна карта, работающая для зарубежных платежей), у российских (Яндекс, GigaChat) - в рублях обычной российской картой. Никаких VPN не требуется: запросы к сервисам уходят с нашего сервера.

Шаг 1. Получите API-ключ и сохраните его в профиле

Ключи вводятся на странице Профиль, блок "API-ключи внешних сервисов". Хранятся они в зашифрованном виде и используются только для запросов от вашего имени; после сохранения поле показывает лишь последние символы ключа. Где ключ взять:

  • Claude (Anthropic) - консоль console.anthropic.com: раздел API KeysCreate Key. Ключ имеет вид "sk-ant-...". Предварительно пополните баланс (раздел Billing - оплата кредитами вперед).
  • ChatGPT (OpenAI) - platform.openai.com (это отдельный от чат-подписки кабинет разработчика): SettingsAPI keysCreate new secret key. Ключ имеет вид "sk-...". Также нужен положительный баланс (Billing).
  • Gemini (Google) - aistudio.google.com (Google AI Studio): кнопка Get API keyCreate API key.
  • Яндекс (AI Studio) - консоль console.yandex.cloud: создайте API-ключ для сервисного аккаунта с доступом к языковым моделям AI Studio. Кроме самого ключа здесь понадобится еще и ID каталога (Folder ID, строка вида "b1g..."): рядом с ключом он не показывается - найдите его в консоли Yandex Cloud в списке каталогов (или в адресной строке консоли: ".../folders/b1g..."). В поле профиля ключ вводится вместе с ID каталога, через двоеточие: "<ID каталога>:<API-ключ>".
  • GigaChat (Сбер) - личный кабинет developers.sber.ru: проект GigaChat APIКлюч авторизации (Authorization Key / Client Secret).

Блок API-ключей внешних сервисов в профиле Блок "API-ключи внешних сервисов" на странице профиля: у сохраненных ключей видны только последние символы; кнопка "Удалить" стирает ключ.

Шаг 2. Запустите распознавание

  1. В окне набора задания нажмите кнопку "ИИ" в правой панели инструментов и выберите сервис из меню. Сервисы, для которых ключ не введен, отмечены пометкой "нет ключа"; пункт "Родотека (скоро)" - прямой запуск распознавания Родотеки, он появится позже.
  2. В открывшемся окне "Распознавание задания через ИИ" выберите модель и усилие (глубину "размышлений": выше усилие - как правило, лучше качество, но дороже и дольше), при необходимости включите галочку "Раскрывать все сокращения". Ниже показывается прогноз стоимости и ожидаемое время: Claude, ChatGPT и Gemini работают через экономный пакетный режим (обычно 3-15 минут, в пиковые часы дольше), Яндекс и GigaChat выполняются сразу. Для зарубежных сервисов стоимость показывается в долларах (со справочным переводом в рубли по курсу ЦБ), для российских - сразу в рублях. Выбранные модель и усилие запоминаются для каждой описи.
  3. Нажмите "Запустить распознавание". В окне отображаются статус, затраченное время, токены, фактическая стоимость и журнал событий.
  4. Окно можно закрыть, не дожидаясь завершения, - распознавание продолжится на сервере, а при следующем открытии задания окно с его состоянием откроется автоматически. Кнопка "Остановить" прерывает распознавание.

Меню кнопки ИИ со списком сервисов распознавания Меню кнопки "ИИ" в окне набора (кнопка и меню выделены красным): выбор сервиса распознавания.

Окно распознавания задания через ИИ Окно распознавания: выбор модели и усилия, прогноз стоимости и времени, журнал. Распознавание стартует только по кнопке "Запустить распознавание".

Результаты

После завершения (при закрытии окна) свежий результат автоматически становится активным источником данных панели предварительного распознавания. Переключаться между вариантами можно в меню панели (кнопка с круговыми стрелочками в её шапке): в разделе "Источник распознавания" перечислены общее распознавание (Родотека/Генотек) и ваши личные ИИ-распознавания с датой и числом страниц; точкой отмечен активный вариант.

Меню панели: выбор источника распознавания Меню панели предварительного распознавания (кнопка с круговыми стрелочками и само меню выделены красным): вверху - переключение текстового/табличного режима, ниже - выбор источника распознавания: общий вариант ("Родотека") или личное ИИ-распознавание (с датой и числом страниц).

Если модель не нашла в задании ни одной строки, окно покажет желтое пояснение: это не сбой, а слабый результат - попробуйте более сильную модель или большее усилие (недорогие "mini"-модели часто не справляются с рукописным текстом).

История всех ваших распознаваний - пункт "Мои распознавания" в меню "Профиль" (в шапке сайта): статусы, модели, токены и стоимость в долларах и рублях; правый клик по строке позволяет перейти к соответствующему заданию.

Обратите внимание: для части архивов персональное ИИ-распознавание может быть отключено по условиям сотрудничества с архивом - в этом случае в меню кнопки "ИИ" будет соответствующая пометка.

Типичные ошибки

Появление большого объема как-то распознанного текста создает соблазн донабрать номера, даты, листаж, и перейти к следующему листу. Но так делать нельзя!

Важно буква за буквой вычитать, сравнивая со сканом, и исправить все огрехи автоматического распознавания согласно общим правилам набора описей. Обращая внимание на все мелочи, включая пробелы и запятые. Вот типичные ошибки, которые возникает желание пропустить после распознавания:

  • "То же" и сокращения. Важно соблюсти все правила инструкции. В том числе, заменить все "то же", раскрыть все сокращения.
  • Инородные пометы. В машинописных описях часто встречаются пометы карандащом или ручкой. Важно не пропустить их и внести в итоговый текст в нужном месте. Автоматическое распознавание их игнорирует, но наша задача - учесть!
  • Знаки препинания и пробелы. При распознавании часто возникают проблемы с точками, запятыми, точками с запятой и другими знаками. Они либо неверно распознаются, либо вообще не распознаются. Кроме этого, часто пробелы оказываются не в тех местах, где должны быть согласно современной языковой норме (например, пробел часто оказывается перед знаком препинания, а не после). Важно внимательно смотреть не только на слова, но и вокруг них.
  • Цифры. Автоматическое распознавание, как правило, путает римскую и арабскую единицы. Важно внимательно смотреть на все числа, и не допускать комбинаций типа "I748 год", "I4 сентября", "положение I3I9" (в этих примерах единица записана римской цифрой, а должна быть записана арабской).
  • Мусор. Иногда после распознавания в тексте возникают случайные символы. Важно их обнаружить и удалить.

Примеры ошибок распознавания: неверно прочитанные слова и пропуск слова Примеры типичных ошибок (отмечены красным; кликните, чтобы рассмотреть): в деле 13 распознавание пропустило слово "уездного" (пунктир на месте пропуска); в деле 14 фамилия "Семенова" прочитана как "Селенова" (буквы "м" и "л" похожи по начертанию); в деле 18 "о краже" превратилось в "о крахе". Такие ошибки не всегда бросаются в глаза - именно поэтому каждую строку нужно вычитывать по скану буква за буквой.

Если опись распознана в табличном режиме, но в датах и номерах слишком много ошибок, переключитесь в текстовый режим. Вероятно, так будет быстрее и удобнее.

Автоматическое распознавание - это не замена процесса набора заголовков описей, а только вспомогательный инструмент, результат работы которого должен быть проверен еще более внимательно, чем результат набора "с нуля"!

Распознавание текста осуществлено техническими возможностям компаний Genotek и Родотека а преобразование в табличный формат - Михаилом Соломенником, за что им огромная благодарность!

Если Вы обнаружили ошибку в описи, пожалуйста, выделите фрагмент и нажмите CTRL+ENTER для внесения исправления!

Партнеры