Как перевести книгу локальной LLM моделью

Локальные Qwen на Mac: OCR, два прохода перевода и рецензент. Steel 2050 без облачных токенов, 19 часов на M1 Max.


Изначально просто хотел прочитать книгу Steel 2050 в бумаге на английском языке, в итоге пришлось делать перевод при помощи LLM, после чего сделал для вас обзор с проверкой прогнозов автора. Все эти материалы можете найти по ссылкам ниже.

В этой рубрике Использование ИИ делюсь рабочими сценариями использования LLM на практике. Сложных руководств по настройке мультиагентной разработки больших приложений здесь не будет, это маленькие улучшайзинги обычной жизни и работы.

Задача перевода книги при помощи LLM моделей возникла у меня не сразу, а как итог попытки почитать Steel 2050 в оригинале, о чем написал в обзоре. К тому моменту уже было на счету 2 переведенных книги и одна собранная с внешним переводчиком. В наше время, когда любой браузер умеет переводить страницу, кажется, что человеческий перевод больше никому не нужен. Но это не работает для художественной литературы. Робот не понимает как можно переводить богатый художественный язык писателя.

Но для Steel 2050 красотой языка можно было пожертвовать.

Книга была у меня в бумажном варианте, замысел был следующий:

  1. сфотографировать каждую страницу
  2. при помощи локальной LLM распознать английский текст и разметить таблицы и графику
  3. при помощи трех ИИ агентов выполнить 2 прохода перевода(технический + художественный) и один проход агента-рецензента

Все скрипты предполагалось написать на qwen-coder, но скорость онлайн модели не идет ни в какое сравнение с моим macbook, потому эту часть работы выполнил cursor.

Использование локальных моделей для этой задачи — это был осознанный выбор. С одной стороны, хотелось проверить мультиагентный сценарий работы, с другой стороны, если можно экономить токены подписки, почему этого не сделать?

Перед Cursor стояла задача разработать скрипты для прохождения всех этапов создания русской версии перевода. Он написал сервис, который последовательно запустил работу четырех агентов:

  1. Vision-агент (распознавание английского текста) модель qwen2.5vl:7b
  2. Перевод, проход А + В qwen2.5:32b, при повторных прогонах qwen2.5:14b
  3. Редактор qwen2.5:32b

Vision-агент (OCR). Локальная vision-модель qwen2.5vl:7b на вход получает фотографию страницы и пишет текст: абзацы, заголовки, таблицы. Страницы, которые уже готовы, не гоняет заново.

Разметка. Из сырого распознавания собирается английская книга. Схема, таблица или картинка на странице вырезается в картинку, в текст ставится ссылка. Колонтитулы и номера страниц выкидываются. На выходе шага собирается markdown файл книги со всей графикой.

Перевод в два прохода. Два прогона перевода(А и В) с одной моделью qwen2.5:32b. Если перевод не удается собрать, вызывался агент уже с моделью qwen2.5:14b на отдельных участках книги. Проход A включает отраслевой перевод, термины по глоссарию, картинки спрятаны за плейсхолдеры, чтобы модель их не «перевела». Проход В формировал новый перевод уже с упором на литературный русский язык.

Рецензент. Снова qwen2.5:32b, но вход другой: рядом лежат ENGLISH и два русских черновика перевода. Смотрит согласование окончаний, обрубленные фразы, верность смыслу. Если фраза бессмысленна, выполняется новый перевод фрагмента по оригиналу. Если всплыли иероглифы (у Qwen было довольно часто), выполнялся отдельный проход «вычисти китайский» с моделью qwen2.5vl:7b.

По окончанию всех прогонов скрипт собрал итоговую книгу в markdown.

Локальные модели работают под управлением Ollama, агенты заведены в OpenWebUI. Все системные промты для агентов написаны Cursor.

Если вы пройдете по ссылке выше в тексте и скачаете результат перевода, будет видно, что несмотря на несколько прогонов агента редактора, есть пара мест с повторами и несколькими техническими артефактами. Эти следы работы Qwen победить дополнительными прогонами не вышло, решил оставить иш как памятник модели версии 2.5.

Цепочка перевода Steel 2050: OCR, разметка, два прохода перевода и рецензент

В этой схеме работы участвует сразу несколько агентов, которые дополняют работу друг друга. Весь прогон на Macbook M1 Max 32Gb занял 19 часов.

В итоге получился скрипт «одна кнопка на любую книгу», при помощи этих же агентов делалась редактура человеческого перевода книги Commodity Finance W. X. Huang.


Сценарий перевода лишь показывает схему работы, где участвует и онлайн модель ИИ, и локальные. Кроме самого перевода могут быть различные сценарии использования, например, подборка и перевод новостей(для редакторов, PR и тд), настройка переводов с отраслевой спецификой(глоссарий) и тд

Комментарии

Оставьте комментарий под своим аккаунтом Telegram — регистрироваться на сайте не нужно.