Для многих машинописных описей выполнено предварительное автоматическое распознавание текста (OCR). При работе с такими описями между формой ввода заголовка и основной таблицей появляется дополнительная панель "Предварительно распознанный текст" (в вертикальном режиме экрана - справа сверху). Она содержит либо желтое текстовое поле с распознанными заголовками, либо таблицу с предварительными данными, а внизу - кнопки "Добавить распознанные заголовки" и "Сбросить изменения". Для внутренних описей появляется еще одна кнопка, "Добавить распознанные заголовки как документы": она трактует данные как описания документов внутри дела, а не самих дел.
Смысл работы всегда один: сначала привести данные в панели в полное соответствие со сканом (вычитать, исправить, дочистить), затем нажать кнопку добавления - строки попадут в основную таблицу набранного, где останется доввести недостающее.
Тем, кому удобнее набирать "с нуля", панель можно свернуть (стрелка в её шапке), чтобы она не занимала место на экране.
Все правки в панели (и в текстовом поле, и в таблице) автоматически сохраняются локально в вашем браузере отдельно для каждой страницы описи: можно листать страницы и возвращаться - правки не потеряются. Но на другом компьютере или после чистки данных браузера их не будет. Кнопка "Сбросить изменения" возвращает исходный распознанный текст текущей страницы.
В разделе "Задания" (а также в окнах корректуры и курации) в списке описей рядом с названием описи выводятся значки сервиса, которым выполнено предварительное распознавание:
При наведении курсора на значок появляется подсказка. Если значка нет - готового распознавания у описи нет, и панель предварительно распознанного текста будет пустой (но ею всё равно можно пользоваться для пакетного ввода заголовков - см. отдельный раздел).
Существует три варианта распознавания описи:
Кнопка с круговыми стрелочками в шапке панели открывает меню, где можно вручную переключиться между текстовым и табличным режимами отображения. Если опись распознана таблицей, но в номерах и датах слишком много мусора, часто быстрее переключиться в текстовый режим и работать только с заголовками.
В большом текстовом поле перечислены заголовки, разделенные пустыми строками. Их нужно очистить от мусора и привести в соответствие с описью прямо в поле, затем нажать "Добавить распознанные заголовки": каждый блок текста (между пустыми строками) станет отдельной строкой основной таблицы. После этого - доввести значения остальных полей, редактируя строки в таблице. В текстовом поле работает и голосовой ввод (значок микрофона, ALT+R).
Если перед нажатием кнопки заполнить в форме ввода сверху поля "Раздел", "Год (раздел)", "Связка" и "Порядковый №" (под первый из заголовков), эти данные будут учтены при добавлении, а порядковые номера проставятся автоматически по возрастанию.
Текстовый режим: в желтом поле - распознанные заголовки, разделенные пустыми строками; справа - скан для сверки.
Таблица панели повторяет состав столбцов вашей описи. Её нужно вычитать, очистить от мусора и дозаполнить, затем нажать "Добавить распознанные заголовки". Флажки (Выбыло, ОЦ, СФ, ФП, МФ, Оцифровано, Рассекречено) отмечаются прямо в таблице панели галочками (клик по ячейке) и переносятся в основную таблицу по каждой строке. Поля "Раздел", "Год (раздел)", "Связка", а также "Делопр. №", "Старый №" и "Примечание", заполненные в форме ввода сверху, при добавлении применяются ко всем добавляемым строкам.
Табличный режим: распознанные данные уже разложены по столбцам, каждую строку сверяем со сканом справа.
Приёмы редактирования:
Контекстное меню (правая кнопка мыши по таблице панели) содержит также: поиск и замену (окно "Найти/Заменить" - как в основной таблице), подменю "Функции" (нормализация регистра, пробелы после №, удаление лишних точек, перенумерация, массовые отметки ОЦ/выбытия), вставку пустых строк выше/ниже, удаление выбранных строк и пункт "Исправить" с подсказками для слов, подчеркнутых проверкой орфографии.
В этом режиме под просмотрщиком образов появляется дополнительная панель с кнопками "Извлечь данные" и "Сбросить сетку таблицы", а поверх скана рисуется красная сетка: рамка таблицы и линии, делящие её на столбцы и строки. Над сеткой показаны названия столбцов ("Порядк. №", "Заголовок", "Даты" и т.д.). Система размечает страницу автоматически, но авторазметка не идеальна - ваша задача её поправить, чтобы линии сетки совпали с реальными границами ячеек таблицы в описи, и нажать "Извлечь данные": распознанный текст будет разложен по ячейкам согласно сетке и попадет в таблицу панели предварительного распознавания, откуда добавляется как обычно. При перелистывании на страницу, для которой панель ещё пуста, извлечение выполняется автоматически.
Разметка на образе: красная сетка с ручками-кружками, названия столбцов над таблицей, извлеченные данные - в панели слева,
кнопки "Извлечь данные" и "Сбросить сетку таблицы" - под просмотрщиком.
Вся правка сетки выполняется ПРАВОЙ кнопкой мыши (левая занята обычными действиями просмотрщика):
На Mac клавиша Ctrl занята системой (Ctrl+клик = правый клик), поэтому модификаторы другие: где выше указано CTRL + правая кнопка - нажимайте ⌘Cmd + правая кнопка, а где ALT + правая кнопка - Control + правая кнопка.
Работа со столбцами (названия над сеткой):
Настроенная сетка запоминается в браузере для каждой страницы, а состав и порядок столбцов - для описи в целом (на страницах без своей сетки структура столбцов конструируется по вашей настройке автоматически). Кнопка "Сбросить сетку таблицы" возвращает авторазметку текущей страницы.
При извлечении система автоматически чистит данные: исправляет типовые ошибки распознавания цифр и букв, склеивает переносы слов, приводит даты к формату ДД.ММ.ГГГГ (в том числе с римскими месяцами и месяцами словами; диапазон раскладывается в начальную и конечную даты), отбрасывает шапку таблицы и номера страниц, восстанавливает пропущенные порядковые номера по последовательности, а строку, в которой заполнен только заголовок, считает названием раздела и проставляет его в последующие строки (год - в "Раздел (год)", текст - в "Раздел"). Годы от сотворения мира (например, /7191г./) выносятся в "Датировку". Вся эта автоматика может ошибаться - результат обязательно вычитывается по скану, ячейка за ячейкой!
Редактор разметки работает только в современных браузерах; в устаревших (например, Firefox 52) выводится предупреждение - обновите браузер.
В меню "Настройки" (под просмотрщиком, рядом с "Извлечь данные") есть две галочки, включённые по умолчанию. Обе достраивают только пустые ячейки - то, что уже распознано на странице, не меняется. Настройки запоминаются для вашего браузера.
Извлекайте страницы по порядку, одну за другой. Достраивание номеров и разделов смотрит на предыдущую страницу, которую вы уже извлекли, поэтому продолжение нумерации и перенос разделов работают только если предыдущая страница обработана раньше. Если извлекать вразнобой, переносить будет не с чего.
Отсюда удобный приём: задайте (или поправьте) раздел на первой странице - и, пока вы извлекаете остальные страницы по порядку, он будет автоматически копироваться на следующие, пока в описи не начнётся новый раздел.
При добавлении строк кнопкой "Добавить распознанные заголовки" приоритет у значений формы "Добавление" (слева вверху: Раздел, Год (раздел), Делопр. №, Примечание, Связка, флаги и т.д.): если поле формы заполнено, оно перекрывает соответствующий столбец распознанной таблицы у всех добавляемых строк; если поле формы пустое - берётся значение из таблицы. Так через форму удобно проставить одно и то же значение сразу на все строки, а точечные отличия оставить в таблице.
На YouTube: открыть видео в новой вкладке (откроется на сайте видеохостинга).
На RuTube:
Панель с текстовым полем доступна во всех заданиях по описям - даже там, где готового распознавания нет (в этом случае она называется "Пакетный ввод заголовков" и по умолчанию свернута; разверните её стрелкой в шапке). Это удобный способ быстро внести сразу много заголовков:
Как и распознанный текст, надиктованный черновик сохраняется локально в браузере отдельно для каждой страницы описи - можно листать страницы и возвращаться к черновику.
Пакетный ввод: идет диктовка (поле обведено красной рамкой, значок микрофона красный), заголовки разделены пустыми строками;
ниже - уже добавленные из этого поля записи.
Если у описи нет готового распознавания (или его качество не устраивает), задание можно распознать самостоятельно через современные нейросети. Поддерживаются пять сервисов: Claude (Anthropic), ChatGPT (OpenAI), Gemini (Google), Яндекс (AI Studio) и GigaChat (Сбер). Такое распознавание - персональное: его результат виден только вам и накладывается поверх общего (Родотека/Генотек), не затрагивая работу других волонтеров.
Распознавание выполняется вашим личным API-ключом выбранного сервиса и оплачивается на его стороне по его тарифам (перед запуском система показывает прогноз стоимости - обычно это единицы центов или рублей за задание). У зарубежных сервисов оплата в долларах (нужна карта, работающая для зарубежных платежей), у российских (Яндекс, GigaChat) - в рублях обычной российской картой. Никаких VPN не требуется: запросы к сервисам уходят с нашего сервера.
Ключи вводятся на странице Профиль, блок "API-ключи внешних сервисов". Хранятся они в зашифрованном виде и используются только для запросов от вашего имени; после сохранения поле показывает лишь последние символы ключа. Где ключ взять:
Блок "API-ключи внешних сервисов" на странице профиля: у сохраненных ключей видны только последние символы; кнопка "Удалить" стирает ключ.
Меню кнопки "ИИ" в окне набора (кнопка и меню выделены красным): выбор сервиса распознавания.
Окно распознавания: выбор модели и усилия, прогноз стоимости и времени, журнал. Распознавание стартует только по кнопке "Запустить распознавание".
После завершения (при закрытии окна) свежий результат автоматически становится активным источником данных панели предварительного распознавания. Переключаться между вариантами можно в меню панели (кнопка с круговыми стрелочками в её шапке): в разделе "Источник распознавания" перечислены общее распознавание (Родотека/Генотек) и ваши личные ИИ-распознавания с датой и числом страниц; точкой отмечен активный вариант.
Меню панели предварительного распознавания (кнопка с круговыми стрелочками и само меню выделены красным): вверху - переключение текстового/табличного режима,
ниже - выбор источника распознавания: общий вариант ("Родотека") или личное ИИ-распознавание (с датой и числом страниц).
Если модель не нашла в задании ни одной строки, окно покажет желтое пояснение: это не сбой, а слабый результат - попробуйте более сильную модель или большее усилие (недорогие "mini"-модели часто не справляются с рукописным текстом).
История всех ваших распознаваний - пункт "Мои распознавания" в меню "Профиль" (в шапке сайта): статусы, модели, токены и стоимость в долларах и рублях; правый клик по строке позволяет перейти к соответствующему заданию.
Обратите внимание: для части архивов персональное ИИ-распознавание может быть отключено по условиям сотрудничества с архивом - в этом случае в меню кнопки "ИИ" будет соответствующая пометка.
Появление большого объема как-то распознанного текста создает соблазн донабрать номера, даты, листаж, и перейти к следующему листу. Но так делать нельзя!
Важно буква за буквой вычитать, сравнивая со сканом, и исправить все огрехи автоматического распознавания согласно общим правилам набора описей. Обращая внимание на все мелочи, включая пробелы и запятые. Вот типичные ошибки, которые возникает желание пропустить после распознавания:
Примеры типичных ошибок (отмечены красным; кликните, чтобы рассмотреть): в деле 13 распознавание пропустило слово "уездного"
(пунктир на месте пропуска); в деле 14 фамилия "Семенова" прочитана как "Селенова" (буквы "м" и "л" похожи по начертанию);
в деле 18 "о краже" превратилось в "о крахе". Такие ошибки не всегда бросаются в глаза - именно поэтому каждую строку
нужно вычитывать по скану буква за буквой.
Если опись распознана в табличном режиме, но в датах и номерах слишком много ошибок, переключитесь в текстовый режим. Вероятно, так будет быстрее и удобнее.
Автоматическое распознавание - это не замена процесса набора заголовков описей, а только вспомогательный инструмент, результат работы которого должен быть проверен еще более внимательно, чем результат набора "с нуля"!
Распознавание текста осуществлено техническими возможностям компаний Genotek и Родотека а преобразование в табличный формат - Михаилом Соломенником, за что им огромная благодарность!
Если Вы обнаружили ошибку в описи, пожалуйста, выделите фрагмент и нажмите CTRL+ENTER для внесения исправления!