Для многих машинописных описей выполнено предварительное автоматическое распознавание текста (OCR). При работе с такими описями между формой ввода заголовка и основной таблицей появляется дополнительная панель "Предварительно распознанный текст" (в вертикальном режиме экрана - справа сверху). Она содержит либо желтое текстовое поле с распознанными заголовками, либо таблицу с предварительными данными, а внизу - кнопки "Добавить распознанные заголовки" и "Сбросить изменения". Для внутренних описей появляется еще одна кнопка, "Добавить распознанные заголовки как документы": она трактует данные как описания документов внутри дела, а не самих дел.
Смысл работы всегда один: сначала привести данные в панели в полное соответствие со сканом (вычитать, исправить, дочистить), затем нажать кнопку добавления - строки попадут в основную таблицу набранного, где останется доввести недостающее.
Тем, кому удобнее набирать "с нуля", панель можно свернуть (стрелка в её шапке), чтобы она не занимала место на экране.
Все правки в панели (и в текстовом поле, и в таблице) автоматически сохраняются локально в вашем браузере отдельно для каждой страницы описи: можно листать страницы и возвращаться - правки не потеряются. Но на другом компьютере или после чистки данных браузера их не будет. Кнопка "Сбросить изменения" возвращает исходный распознанный текст текущей страницы.
В разделе "Задания" (а также в окнах корректуры и курации) в списке описей рядом с названием описи выводятся значки сервиса, которым выполнено предварительное распознавание:
При наведении курсора на значок появляется подсказка. Если значка нет - готового распознавания у описи нет, и панель предварительно распознанного текста будет пустой (но ею всё равно можно пользоваться для пакетного ввода заголовков - см. отдельный раздел).
Существует три варианта распознавания описи:
Кнопка с круговыми стрелочками в шапке панели открывает меню, где можно вручную переключиться между текстовым и табличным режимами отображения. Если опись распознана таблицей, но в номерах и датах слишком много мусора, часто быстрее переключиться в текстовый режим и работать только с заголовками.
В большом текстовом поле перечислены заголовки, разделенные пустыми строками. Их нужно очистить от мусора и привести в соответствие с описью прямо в поле, затем нажать "Добавить распознанные заголовки": каждый блок текста (между пустыми строками) станет отдельной строкой основной таблицы. После этого - доввести значения остальных полей, редактируя строки в таблице. В текстовом поле работает и голосовой ввод (значок микрофона, ALT+R).
Если перед нажатием кнопки заполнить в форме ввода сверху поля "Раздел", "Год (раздел)", "Связка" и "Порядковый №" (под первый из заголовков), эти данные будут учтены при добавлении, а порядковые номера проставятся автоматически по возрастанию.

Текстовый режим: в желтом поле - распознанные заголовки, разделенные пустыми строками; справа - скан для сверки.
Таблица панели повторяет состав столбцов вашей описи. Её нужно вычитать, очистить от мусора и дозаполнить, затем нажать "Добавить распознанные заголовки". Флажки (Выбыло, ОЦ, СФ, ФП, МФ, Оцифровано, Рассекречено) отмечаются прямо в таблице панели галочками (клик по ячейке) и переносятся в основную таблицу по каждой строке. Поля "Раздел", "Год (раздел)", "Связка", а также "Делопр. №", "Старый №" и "Примечание", заполненные в форме ввода сверху, при добавлении применяются ко всем добавляемым строкам.

Табличный режим: распознанные данные уже разложены по столбцам, каждую строку сверяем со сканом справа.
Приёмы редактирования:
Контекстное меню (правая кнопка мыши по таблице панели) содержит также: поиск и замену (окно "Найти/Заменить" - как в основной таблице), подменю "Функции" (нормализация регистра, пробелы после №, удаление лишних точек, перенумерация, массовые отметки ОЦ/выбытия), вставку пустых строк выше/ниже, удаление выбранных строк и пункт "Исправить" с подсказками для слов, подчеркнутых проверкой орфографии.
В этом режиме под просмотрщиком образов появляется дополнительная панель с кнопками "Извлечь данные" и "Сбросить сетку таблицы", а поверх скана рисуется красная сетка: рамка таблицы и линии, делящие её на столбцы и строки. Над сеткой показаны названия столбцов ("Порядк. №", "Заголовок", "Даты" и т.д.). Система размечает страницу автоматически, но авторазметка не идеальна - ваша задача её поправить, чтобы линии сетки совпали с реальными границами ячеек таблицы в описи, и нажать "Извлечь данные": распознанный текст будет разложен по ячейкам согласно сетке и попадет в таблицу панели предварительного распознавания, откуда добавляется как обычно. При перелистывании на страницу, для которой панель ещё пуста, извлечение выполняется автоматически.

Разметка на образе: красная сетка с ручками-кружками, названия столбцов над таблицей, извлеченные данные - в панели слева,
кнопки "Извлечь данные" и "Сбросить сетку таблицы" - под просмотрщиком.
Вся правка сетки выполняется ПРАВОЙ кнопкой мыши (левая занята обычными действиями просмотрщика):
Работа со столбцами (названия над сеткой):
Настроенная сетка запоминается в браузере для каждой страницы, а состав и порядок столбцов - для описи в целом (на страницах без своей сетки структура столбцов конструируется по вашей настройке автоматически). Кнопка "Сбросить сетку таблицы" возвращает авторазметку текущей страницы.
При извлечении система автоматически чистит данные: исправляет типовые ошибки распознавания цифр и букв, склеивает переносы слов, приводит даты к формату ДД.ММ.ГГГГ (в том числе с римскими месяцами и месяцами словами; диапазон раскладывается в начальную и конечную даты), отбрасывает шапку таблицы и номера страниц, восстанавливает пропущенные порядковые номера по последовательности, а строку, в которой заполнен только заголовок, считает названием раздела и проставляет его в последующие строки (год - в "Раздел (год)", текст - в "Раздел"). Годы от сотворения мира (например, /7191г./) выносятся в "Датировку". Вся эта автоматика может ошибаться - результат обязательно вычитывается по скану, ячейка за ячейкой!
Редактор разметки работает только в современных браузерах; в устаревших (например, Firefox 52) выводится предупреждение - обновите браузер.
На YouTube:
На RuTube:
Панель с текстовым полем доступна во всех заданиях по описям - даже там, где готового распознавания нет (в этом случае она называется "Пакетный ввод заголовков" и по умолчанию свернута; разверните её стрелкой в шапке). Это удобный способ быстро внести сразу много заголовков:
Как и распознанный текст, надиктованный черновик сохраняется локально в браузере отдельно для каждой страницы описи - можно листать страницы и возвращаться к черновику.

Пакетный ввод: идет диктовка (поле обведено красной рамкой, значок микрофона красный), заголовки разделены пустыми строками;
ниже - уже добавленные из этого поля записи.
Доступ к модулю пока что не открыт, запуск ожидается в августе 2026.
Если у описи нет готового распознавания (или его качество не устраивает), задание можно распознать самостоятельно через нейросети (Claude и другие). Такое распознавание - персональное: его результат виден только вам и накладывается поверх общего, не затрагивая работу других волонтеров.
Для работы нужен собственный API-ключ соответствующего сервиса - он указывается на странице Профиль (ключи хранятся в зашифрованном виде). Распознавание оплачивается на стороне сервиса-провайдера по его тарифам с вашего ключа; система заранее показывает прогноз стоимости.
Как запустить:
После завершения (при закрытии окна) свежий результат автоматически становится активным источником данных панели предварительного распознавания. Переключаться между вариантами можно в меню панели (кнопка с круговыми стрелочками): пункт "Общее (Родотека/Генотек)" возвращает общее распознавание, ниже перечислены ваши личные ИИ-распознавания с датой и числом страниц. Выбранные модель и настройки запоминаются для каждой описи.
Появление большого объема как-то распознанного текста создает соблазн донабрать номера, даты, листаж, и перейти к следующему листу. Но так делать нельзя!
Важно буква за буквой вычитать, сравнивая со сканом, и исправить все огрехи автоматического распознавания согласно общим правилам набора описей. Обращая внимание на все мелочи, включая пробелы и запятые. Вот типичные ошибки, которые возникает желание пропустить после распознавания:

Примеры типичных ошибок (отмечены красным; кликните, чтобы рассмотреть): в деле 13 распознавание пропустило слово "уездного"
(пунктир на месте пропуска); в деле 14 фамилия "Семенова" прочитана как "Селенова" (буквы "м" и "л" похожи по начертанию);
в деле 18 "о краже" превратилось в "о крахе". Такие ошибки не всегда бросаются в глаза - именно поэтому каждую строку
нужно вычитывать по скану буква за буквой.
Если опись распознана в табличном режиме, но в датах и номерах слишком много ошибок, переключитесь в текстовый режим. Вероятно, так будет быстрее и удобнее.
Автоматическое распознавание - это не замена процесса набора заголовков описей, а только вспомогательный инструмент, результат работы которого должен быть проверен еще более внимательно, чем результат набора "с нуля"!
Распознавание текста осуществлено техническими возможностям компаний Genotek и Родотека а преобразование в табличный формат - Михаилом Соломенником, за что им огромная благодарность!
Если Вы обнаружили ошибку в описи, пожалуйста, выделите фрагмент и нажмите CTRL+ENTER для внесения исправления!