ГлавнаяБлог → Как ИИ упрощает работу

Как ИИ упрощает работу · Часть 3

Книга на 715 страниц, которой нет на русском: как её перевели со сканов за выходные

16 сентября 2026Кирилл Кривицкий

Меня попросили найти и перевести книгу. Старый справочник, издание 1991 года, иностранный язык. На русский его никто никогда не переводил.

Нашёлся только скан: 715 страниц, сфотографированных с бумаги.

Сколько стоит такая просьба

Я открыл прайсы бюро переводов и посчитал по своему объёму.

В переводе объём меряют страницами по 1800 знаков. В книге их вышло около девятисот. Дальше простое умножение:

  • по самому дешёвому найденному тарифу — четыреста с лишним тысяч рублей;
  • по обычному тарифу крупного бюро — ближе к миллиону;
  • плюс отдельная строка «восстановление макета документов низкого качества»: 130–170 рублей за каждую физическую страницу, то есть ещё около сотни тысяч сверху.

Сроки — несколько месяцев.

За такие деньги просьбу «найди и переведи» не выполняют. На этом разговор обычно и заканчивается. Поэтому подобные книги и лежат десятилетиями непереведёнными: не потому что они никому не нужны, а потому что нужны слишком немногим.

Почему это не решается переводчиком

Казалось бы: загрузи файл в переводчик и жди.

Не выйдет, потому что переводить нечего. В файле нет текста — там фотографии бумажных страниц: пожелтевших, с заломами, со следами типографии сорокалетней давности.

Стандартный путь здесь — распознавание, OCR. С этой книгой он не работает. Распознавалки на незнакомом алфавите сдаются, и выдают примерно такое: слова разорваны пробелами прямо посреди букв, часть букв подменена на внешне похожие, строки перемешаны между собой.

Переводчик такую кашу добросовестно переведёт в другую кашу. Проверять её всё равно придётся по оригиналу, то есть глазами и вручную — а это и есть та самая работа на несколько месяцев, ради которой всё затевалось.

Что сделали вместо распознавания

Распознавать не стали вообще.

Каждая страница отдавалась ИИ как изображение, с задачей посмотреть на неё и прочитать. Не «разбери символы и собери из них строки», а «вот фотография страницы, пойми, что здесь написано, и переведи». Ровно то, что сделал бы человек, знающий язык.

Разница принципиальная. Распознавание работает с формой букв и на незнакомом шрифте ломается. Чтение работает со смыслом: по соседним словам понятно, какая буква стёрлась, и фраза восстанавливается целиком, а не по символам.

Конвейер

Страницы шли партиями по четыре, и каждая партия проходила два круга.

Первый — перевод. Агент получает четыре скана подряд и переводит всё, что на них есть.

Второй — сверка. Другой агент получает те же четыре скана плюс черновик первого. Его задача не перевести заново, а сверить слово за словом: найти ошибки чтения, пропуски, отсебятину, выправить термины и записать готовый текст в файл.

Почему по четыре. Статьи в справочнике короткие, и на таком отрезке модель держит перед глазами весь контекст сразу: не теряет фразу, разорванную переносом на другую страницу, и не начинает новую статью с середины.

Почему два круга. Переводчик, который сам себя проверяет, свои ошибки не видит — это верно и для человека, и для машины. Свежий взгляд со сканами на руках ловит то, что первый проход прочитал неверно.

Правило, которое было важнее скорости

Местами бумага не выдержала: где-то съеден угол, где-то из-за залома не читаются несколько строк.

Главное правило в задаче звучало так: не выдумывать. Не видишь текст — пиши, что здесь утрата, и переходи дальше. Спорное чтение — помечай как спорное.

На 715 страницах вышло 17 таких пометок. Семнадцать мест, где честно сказано «не разобрать», вместо семнадцати мест с правдоподобно придуманным текстом.

Для справочника, где идут дозировки, это разница принципиальная. Придуманная доза выглядит так же убедительно, как настоящая — и именно поэтому опаснее откровенного пропуска.

Что получилось

  • 1 689 000 знаков русского текста — объём трёх обычных книг;
  • 337 статей, страницы с 3-й по 715-ю, без единого пропуска;
  • попутно собрались два вспомогательных списка: все упомянутые в книге названия и словарь терминов;
  • на выходе один файл, который открывается в Ворде.

Времени ушло три дня, с пятницы по воскресенье. Личного участия в них несколько часов: поставить задачу, проверить пробный кусок из десяти страниц, запустить остальное блоками. Дальше машина считала сама.

Что это стоило

Есть тарифы, где платишь за объём обработанного текста. По ним такая работа обошлась бы примерно от трёх до пятнадцати тысяч рублей, смотря какую модель брать.

Фактически не было заплачено ничего сверх обычной подписки.

С четырьмястами тысячами по прайсу бюро это даже не сравнивается.

Что из этого следует

Ускорилась не работа. Изменился список задач, за которые вообще имеет смысл браться.

Перевести книгу, разобрать архив, расшифровать старые записи, привести в порядок документы, до которых десять лет не доходили руки — всё это существовало и раньше. Просто стоило дороже результата, и потому не откладывалось, а вычёркивалось, ещё не начавшись.

Вычеркнутого у каждого набирается за жизнь довольно много.

Понравился разбор?

Внедряю ИИ в бизнес и разбираю рынок недвижимости на данных. Обсудим вашу задачу или проект?

← Все материалы