Предварительное автоматическое распознавание текста

(редакция от 13.08.2026)

Для многих машинописных описей выполнено предварительное автоматическое распознавание текста (OCR). При работе с такими описями между формой ввода заголовка и основной таблицей появляется дополнительная панель "Предварительно распознанный текст" (в вертикальном режиме экрана - справа сверху). Она содержит либо желтое текстовое поле с распознанными заголовками, либо таблицу с предварительными данными, а внизу - кнопки "Добавить распознанные заголовки" и "Сбросить изменения". Для внутренних описей появляется еще одна кнопка, "Добавить распознанные заголовки как документы": она трактует данные как описания документов внутри дела, а не самих дел.

Смысл работы всегда один: сначала привести данные в панели в полное соответствие со сканом (вычитать, исправить, дочистить), затем нажать кнопку добавления - строки попадут в основную таблицу набранного, где останется доввести недостающее.

Тем, кому удобнее набирать "с нуля", панель можно свернуть (стрелка в её шапке), чтобы она не занимала место на экране.

Все правки в панели (и в текстовом поле, и в таблице) автоматически сохраняются локально в вашем браузере отдельно для каждой страницы описи: можно листать страницы и возвращаться - правки не потеряются. Но на другом компьютере или после чистки данных браузера их не будет. Кнопка "Сбросить изменения" возвращает исходный распознанный текст текущей страницы.

Как узнать, есть ли у описи распознавание

В разделе "Задания" (а также в окнах корректуры и курации) в списке описей рядом с названием описи выводятся значки сервиса, которым выполнено предварительное распознавание:

  • Родотека - зеленый квадратик с буквой "Р" - распознавание выполнено сервисом "Родотека";
  • Генотек - бирюзовый квадратик с эмблемой ДНК - распознавание выполнено сервисом "Генотек".

При наведении курсора на значок появляется подсказка. Если значка нет - готового распознавания у описи нет, и панель предварительно распознанного текста будет пустой (но ею всё равно можно пользоваться для пакетного ввода заголовков - см. отдельный раздел).

Режимы панели и переключение

Существует три варианта распознавания описи:

  • только заголовки - текстовый режим (желтое поле);
  • вся таблица - табличный режим (номера, заголовки, даты, листаж и т.д. уже разложены по столбцам);
  • таблица с разметкой на образе - самый новый режим: поверх скана рисуется красная сетка таблицы, которую можно править, а данные извлекаются в панель по этой сетке (см. раздел "Разметка таблицы на образе" ниже).

Кнопка с круговыми стрелочками в шапке панели открывает меню, где можно вручную переключиться между текстовым и табличным режимами отображения. Если опись распознана таблицей, но в номерах и датах слишком много мусора, часто быстрее переключиться в текстовый режим и работать только с заголовками.

Текстовый режим (только заголовки)

В большом текстовом поле перечислены заголовки, разделенные пустыми строками. Их нужно очистить от мусора и привести в соответствие с описью прямо в поле, затем нажать "Добавить распознанные заголовки": каждый блок текста (между пустыми строками) станет отдельной строкой основной таблицы. После этого - доввести значения остальных полей, редактируя строки в таблице. В текстовом поле работает и голосовой ввод (значок микрофона, ALT+R).

Если перед нажатием кнопки заполнить в форме ввода сверху поля "Раздел", "Год (раздел)", "Связка" и "Порядковый №" (под первый из заголовков), эти данные будут учтены при добавлении, а порядковые номера проставятся автоматически по возрастанию.

Текстовый режим панели предварительного распознавания
Текстовый режим: в желтом поле - распознанные заголовки, разделенные пустыми строками; справа - скан для сверки.

Табличный режим

Таблица панели повторяет состав столбцов вашей описи. Её нужно вычитать, очистить от мусора и дозаполнить, затем нажать "Добавить распознанные заголовки". Флажки (Выбыло, ОЦ, СФ, ФП, МФ, Оцифровано, Рассекречено) отмечаются прямо в таблице панели галочками (клик по ячейке) и переносятся в основную таблицу по каждой строке. Поля "Раздел", "Год (раздел)", "Связка", а также "Делопр. №", "Старый №" и "Примечание", заполненные в форме ввода сверху, при добавлении применяются ко всем добавляемым строкам.

Табличный режим панели предварительного распознавания
Табличный режим: распознанные данные уже разложены по столбцам, каждую строку сверяем со сканом справа.

Приёмы редактирования:

  • Редактирование ячейки - по клику. В узких столбцах редактор при необходимости расширяется, чтобы был виден весь текст (как в Google Sheets); ENTER там завершает ввод. В столбце "Заголовок" ENTER переводит курсор на новую строку, а завершить редактирование можно щелчком по другой ячейке или клавишей TAB.
  • Строки с ошибками (неправильный формат даты, номера и т.п.) подсвечиваются розовым. При нажатии кнопки добавления выполняется полная проверка, и выводится список вида "Строка N: описание ошибки" - пока ошибки не исправлены, строки не добавятся.
  • Если распознавание перепутало местами значения двух столбцов (например, начальную и конечную даты), выделите мышью ячейки в двух соседних столбцах (протянув выделение по нужным строкам) и выберите в контекстном меню "Поменять значения ячеек местами между столбцами".

Контекстное меню (правая кнопка мыши по таблице панели) содержит также: поиск и замену (окно "Найти/Заменить" - как в основной таблице), подменю "Функции" (нормализация регистра, пробелы после №, удаление лишних точек, перенумерация, массовые отметки ОЦ/выбытия), вставку пустых строк выше/ниже, удаление выбранных строк и пункт "Исправить" с подсказками для слов, подчеркнутых проверкой орфографии.

Разметка таблицы на образе (новый режим)

В этом режиме под просмотрщиком образов появляется дополнительная панель с кнопками "Извлечь данные" и "Сбросить сетку таблицы", а поверх скана рисуется красная сетка: рамка таблицы и линии, делящие её на столбцы и строки. Над сеткой показаны названия столбцов ("Порядк. №", "Заголовок", "Даты" и т.д.). Система размечает страницу автоматически, но авторазметка не идеальна - ваша задача её поправить, чтобы линии сетки совпали с реальными границами ячеек таблицы в описи, и нажать "Извлечь данные": распознанный текст будет разложен по ячейкам согласно сетке и попадет в таблицу панели предварительного распознавания, откуда добавляется как обычно. При перелистывании на страницу, для которой панель ещё пуста, извлечение выполняется автоматически.

Разметка таблицы на образе: красная сетка и названия столбцов
Разметка на образе: красная сетка с ручками-кружками, названия столбцов над таблицей, извлеченные данные - в панели слева, кнопки "Извлечь данные" и "Сбросить сетку таблицы" - под просмотрщиком.

Вся правка сетки выполняется ПРАВОЙ кнопкой мыши (левая занята обычными действиями просмотрщика):

  • Передвинуть линию - навести курсор (линия подсветится) и перетащить правой кнопкой. Так же двигаются рамка (за стороны и углы) и концы линий (кружки-ручки).
  • Добавить линию: CTRL + правая кнопка - горизонтальная линия через точку клика; ALT + правая кнопка - вертикальная линия через точку клика. Можно и просто протянуть линию правой кнопкой внутри рамки от одного края до противоположного.
  • Удалить линию - навести курсор на линию (она подсветится) и нажать Delete или D (работает в любой раскладке клавиатуры).
  • Нарисовать рамку заново - если рамки нет (после удаления), обвести таблицу протяжкой правой кнопкой.

Работа со столбцами (названия над сеткой):

  • Клик по названию столбца открывает меню. Пункт "Пропуск" исключает столбец из извлечения (например, если в бумажной таблице есть столбец, которого нет в описи на сайте) - последующие названия сдвигаются вправо; "Убрать пропуск" возвращает как было.
  • Для столбцов дат в том же меню выбирается режим "Одна дата" (в бумажной таблице обе даты в одном столбце) или "Две даты" (отдельные столбцы начальной и конечной даты).
  • Название столбца можно перетащить мышью на другое место, если порядок столбцов в бумажной таблице отличается.

Настроенная сетка запоминается в браузере для каждой страницы, а состав и порядок столбцов - для описи в целом (на страницах без своей сетки структура столбцов конструируется по вашей настройке автоматически). Кнопка "Сбросить сетку таблицы" возвращает авторазметку текущей страницы.

При извлечении система автоматически чистит данные: исправляет типовые ошибки распознавания цифр и букв, склеивает переносы слов, приводит даты к формату ДД.ММ.ГГГГ (в том числе с римскими месяцами и месяцами словами; диапазон раскладывается в начальную и конечную даты), отбрасывает шапку таблицы и номера страниц, восстанавливает пропущенные порядковые номера по последовательности, а строку, в которой заполнен только заголовок, считает названием раздела и проставляет его в последующие строки (год - в "Раздел (год)", текст - в "Раздел"). Годы от сотворения мира (например, /7191г./) выносятся в "Датировку". Вся эта автоматика может ошибаться - результат обязательно вычитывается по скану, ячейка за ячейкой!

Редактор разметки работает только в современных браузерах; в устаревших (например, Firefox 52) выводится предупреждение - обновите браузер.

Видео демонстрация

На YouTube:

На RuTube:

Пакетный ввод заголовков без распознавания (в т.ч. голосом)

Панель с текстовым полем доступна во всех заданиях по описям - даже там, где готового распознавания нет (в этом случае она называется "Пакетный ввод заголовков" и по умолчанию свернута; разверните её стрелкой в шапке). Это удобный способ быстро внести сразу много заголовков:

  1. Разверните панель и установите курсор в текстовое поле.
  2. Надиктуйте заголовки через голосовой ввод (значок микрофона в поле или ALT+R) либо наберите/вставьте их текстом. Каждый заголовок отделяйте от следующего пустой строкой (двойной ENTER).
  3. При необходимости заполните в форме ввода сверху поля "Раздел", "Год (раздел)", "Связка" и "Порядковый №" (под первый из заголовков).
  4. Нажмите "Добавить распознанные заголовки" - все заголовки разом станут строками основной таблицы, а порядковые номера проставятся автоматически.

Как и распознанный текст, надиктованный черновик сохраняется локально в браузере отдельно для каждой страницы описи - можно листать страницы и возвращаться к черновику.

Пакетный ввод заголовков: идет голосовой ввод
Пакетный ввод: идет диктовка (поле обведено красной рамкой, значок микрофона красный), заголовки разделены пустыми строками; ниже - уже добавленные из этого поля записи.

Персональное ИИ-распознавание

Доступ к модулю пока что не открыт, запуск ожидается в августе 2026.

Если у описи нет готового распознавания (или его качество не устраивает), задание можно распознать самостоятельно через нейросети (Claude и другие). Такое распознавание - персональное: его результат виден только вам и накладывается поверх общего, не затрагивая работу других волонтеров.

Для работы нужен собственный API-ключ соответствующего сервиса - он указывается на странице Профиль (ключи хранятся в зашифрованном виде). Распознавание оплачивается на стороне сервиса-провайдера по его тарифам с вашего ключа; система заранее показывает прогноз стоимости.

Как запустить:

  1. В окне набора задания нажмите кнопку "ИИ" в правой панели инструментов и выберите сервис из меню (сервисы без ключа отмечены пометкой "нет ключа").
  2. В открывшемся окне "Распознавание задания через ИИ" выберите модель и усилие (глубину "размышлений"), при желании включите галочку "Раскрывать все сокращения". Ниже показывается прогноз стоимости в долларах и рублях и ожидаемое время (обычно 3-15 минут, так как используется экономный пакетный режим; в пиковые часы дольше).
  3. Нажмите "Запустить распознавание". В окне отображаются статус, затраченное время, токены и фактическая стоимость, а также журнал событий.
  4. Окно можно закрыть, не дожидаясь завершения, - распознавание продолжится на сервере, а при следующем открытии задания окно с его состоянием откроется автоматически. Кнопка "Остановить" прерывает распознавание.

После завершения (при закрытии окна) свежий результат автоматически становится активным источником данных панели предварительного распознавания. Переключаться между вариантами можно в меню панели (кнопка с круговыми стрелочками): пункт "Общее (Родотека/Генотек)" возвращает общее распознавание, ниже перечислены ваши личные ИИ-распознавания с датой и числом страниц. Выбранные модель и настройки запоминаются для каждой описи.

Типичные ошибки

Появление большого объема как-то распознанного текста создает соблазн донабрать номера, даты, листаж, и перейти к следующему листу. Но так делать нельзя!

Важно буква за буквой вычитать, сравнивая со сканом, и исправить все огрехи автоматического распознавания согласно общим правилам набора описей. Обращая внимание на все мелочи, включая пробелы и запятые. Вот типичные ошибки, которые возникает желание пропустить после распознавания:

  • "То же" и сокращения. Важно соблюсти все правила инструкции. В том числе, заменить все "то же", раскрыть все сокращения.
  • Инородные пометы. В машинописных описях часто встречаются пометы карандащом или ручкой. Важно не пропустить их и внести в итоговый текст в нужном месте. Автоматическое распознавание их игнорирует, но наша задача - учесть!
  • Знаки препинания и пробелы. При распознавании часто возникают проблемы с точками, запятыми, точками с запятой и другими знаками. Они либо неверно распознаются, либо вообще не распознаются. Кроме этого, часто пробелы оказываются не в тех местах, где должны быть согласно современной языковой норме (например, пробел часто оказывается перед знаком препинания, а не после). Важно внимательно смотреть не только на слова, но и вокруг них.
  • Цифры. Автоматическое распознавание, как правило, путает римскую и арабскую единицы. Важно внимательно смотреть на все числа, и не допускать комбинаций типа "I748 год", "I4 сентября", "положение I3I9" (в этих примерах единица записана римской цифрой, а должна быть записана арабской).
  • Мусор. Иногда после распознавания в тексте возникают случайные символы. Важно их обнаружить и удалить.

Примеры ошибок распознавания: неверно прочитанные слова и пропуск слова
Примеры типичных ошибок (отмечены красным; кликните, чтобы рассмотреть): в деле 13 распознавание пропустило слово "уездного" (пунктир на месте пропуска); в деле 14 фамилия "Семенова" прочитана как "Селенова" (буквы "м" и "л" похожи по начертанию); в деле 18 "о краже" превратилось в "о крахе". Такие ошибки не всегда бросаются в глаза - именно поэтому каждую строку нужно вычитывать по скану буква за буквой.

Если опись распознана в табличном режиме, но в датах и номерах слишком много ошибок, переключитесь в текстовый режим. Вероятно, так будет быстрее и удобнее.

Автоматическое распознавание - это не замена процесса набора заголовков описей, а только вспомогательный инструмент, результат работы которого должен быть проверен еще более внимательно, чем результат набора "с нуля"!

Распознавание текста осуществлено техническими возможностям компаний Genotek и Родотека а преобразование в табличный формат - Михаилом Соломенником, за что им огромная благодарность!

Если Вы обнаружили ошибку в описи, пожалуйста, выделите фрагмент и нажмите CTRL+ENTER для внесения исправления!

Партнеры