Doc-HTML-Translate Документація (UK)

Швидке локальне читання книг і безкоштовний переклад у Chrome

Конвертуйте EPUB/PDF та інші формати у локальні HTML-сторінки, потім читайте у Chrome і перекладайте вбудованим перекладачем браузера. Без API-ключа, без підписки і без зайвих церемоній.

Іпостасі - усі способи користуватися

Doc-HTML-Translate існує в кількох іпостасях; у них спільний конвертер і спільна ідея - віддати браузеру чистий HTML і дати йому перекласти. Обирай, що зручніше.

Рекомендований сценарій (безкоштовно)

Найзручніший щоденний варіант, і так, «безкоштовно» тут справді означає безкоштовно:

  • Відкрити файл застосунком або запустити звичайну команду
  • Відкриття згенерованого index у Chrome
  • Переклад сторінки на потрібну мову через вбудований переклад Chrome
doc-html-translate.exe "book.epub" # або # doc-html-translate.exe "book.pdf"

Переваги: без API-ключа, без платних викликів, дуже швидкий старт.

Швидкий старт

Збірка

go build -o build/doc-html-translate.exe ./cmd/doc-html-translate

Запуск

doc-html-translate.exe "book.epub" doc-html-translate.exe -notranslate "book.epub" # явний режим без перекладу doc-html-translate.exe -src en -dst uk "book.epub" doc-html-translate.exe -google "book.epub" doc-html-translate.exe -ollama "book.epub"

Підтримувані формати

EPUB, PDF, TXT, Markdown, FB2, RTF, HTML, MOBI, AZW3 і комікси CBZ/CBR/CB7/CBT. Набір, відверто кажучи, пристойний.

А ще комікси (CBZ / CBR / CB7 / CBT): це контейнер зі сторінками-картинками без текстового шару, він відкривається сторінка за сторінкою з примусово ввімкненим OCR, тому текст у «бульбашках» розпізнається і лягає перекладними плашками поверх кожної сторінки. CBZ і CBT не потребують нічого додатково; CBR і CB7 потребують встановленого 7-Zip (той самий прийом із зовнішнім інструментом, що й MOBI з Calibre).

А ще одиночна картинка (PNG, JPG, JPEG, WebP, GIF, BMP, TIFF): застосунок розпізнає на ній текст і накладає його перекладними плашками поверх зображення, щоб вбудований переклад сторінки в Chrome/Edge працював прямо на картинці - той самий оверлей, що робить розширення для браузера. Потрібен OCR-рушій Tesseract (див. -ocr-lang).

MOBI та AZW3: потрібен встановлений Calibre. Комікси CBR і CB7: потрібен встановлений 7-Zip (CBZ і CBT не потребують нічого додатково). Файли з DRM не підтримуються - конвертер поважає замки, які не вміє зламувати.

Звичайний текст (.txt) декодується за провідними байтами - мітка порядку байтів UTF-8/UTF-16, потім коректний UTF-8, потім застаріла кирилична кодова сторінка (Windows-1251, KOI8-R, CP866) за детекцією - тож .txt із часів DOS або збережений у Notepad як «Unicode» читається текстом, а не «кракозябрами». Нечитаний бінарник (.docx, .djvu чи архів коміксу без 7-Zip) відхиляється з назвою формату, а не перетворюється на сміттєвий документ.

Зручність читання

У згенерований HTML вбудовано невеликий клієнтський шар для читання - сервер няньчити не треба, спокійно працює через file://:

Односторінкові документи не мають навбара, тому цей шар до них не застосовується.

Додаткові зовнішні інструменти

Застосунок працює одразу для EPUB, TXT, FB2, RTF, HTML, Markdown. Інструменти нижче суто опціональні - ставте їх, лише якщо хочете повну підтримку зображень PDF та додаткових форматів.

ІнструментПризначенняПотрібен дляЯк встановити
pdftotext
(Xpdf / Poppler)
Якісне вилучення тексту з PDF - краще обробляє складні шрифти, лігатури, багатоколонковий макет PDF-файли - необов'язково, при відсутності використовується вбудований fallback xpdfreader.com → «Xpdf tools»
або вже входить до Git for Windows
ffmpeg Конвертує JPEG 2000 зображення (.jpx) з PDF у JPEG - браузери й у 2026 році ввічливо відмовляються показувати JPEG 2000 PDF-файли із зображеннями у форматі JPEG2000 (поширено в комерційних PDF) gyan.dev/ffmpeg → «release essentials»
або winget install ffmpeg
Calibre Конвертує MOBI / AZW3 у EPUB перед обробкою Обов'язковий для підтримки форматів MOBI та AZW3 calibre-ebook.com
7-Zip Розпаковує комікси CBR (RAR) і CB7 (7z) у сторінки-картинки Комікси CBR і CB7 - CBZ і CBT не потребують нічого додатково 7-zip.org

Без pdftotext: використовується вбудований Go-рідер PDF (дещо нижча якість). Без ffmpeg: зображення JPEG2000 у PDF не відображатимуться в браузері. Без Calibre: файли MOBI/AZW3 не відкриваються. Без 7-Zip: комікси CBR/CB7 не відкриваються.

Основні прапорці

Усі опціональні. Значення за замовчуванням розумні, тож цю таблицю можна ігнорувати, доки не зʼявиться власна думка.

ПрапорецьЗа замовчуваннямОпис
-notranslatefalseЛише конвертація, без перекладу
-noopenfalseНе відкривати браузер автоматично
-googlefalseПереклад через Google Cloud Translation API
-ollamafalseЛокальний переклад Ollama
-ocrfalseРозпізнати текст на зображеннях документа (OCR) і накласти його зверху справжнім перекладним HTML (потрібен Tesseract)
-ocr-lang(-src)Мова(и) OCR, напр. eng або eng+rus (за замовчуванням з -src, інакше eng)
-ocr-langsfalseПоказати встановлені/доступні мови OCR і вийти
-ocr-downloademptyЗавантажити мовний пакет OCR (напр. -ocr-download rus) і вийти
-max-cost0Перервати платний переклад до відправлення, якщо оцінка вартості в USD перевищує N. Якщо сумніваєтеся, 0 (без ліміту) - цілком гідний вибір
-split5000Розбиття сторінок за кількістю символів, 0 вимикає
-toc-depth0Глибина вкладеності змісту на index.html, 0 = без обмежень, 1 = лише розділи
-folderemptyПапка для результату
-srcenМова джерела
-dstruМова перекладу
-ui-lang(системна)Мова інтерфейсу: en ru uk de it es fr pt ar hi bn ur zh. Порожньо - мова Windows
-forcefalseПерезібрати навіть якщо output вже існує
-registerfalseЗа бажанням зробити застосунок обробником за замовчуванням для EPUB, PDF та інших підтримуваних файлів (типово вимкнено; та сама кнопка-тумблер у застосунку doc-html-ui). Перший запуск лише додає пункт правого кліку і пропонує це.
-unregisterfalseЗняти асоціацію обробника за замовчуванням (пункт правого кліку «Convert to HTML» і «Відкрити за допомогою» залишаються).
-register-openwithfalseДодати застосунок до списку Windows "Відкрити за допомогою" і пункт правого кліку «Convert to HTML» без призначення обробником за замовчуванням. Застосунок doc-html-ui робить це автоматично під час запуску, тож програма завжди доступна, навіть якщо ви не призначали її за замовчуванням.

Усі опції вище доступні й у графічному застосунку doc-html-ui - вибір файлу, drag & drop, глибина змісту, ліміт вартості та тумблер «обробник за замовчуванням» (за бажанням, типово вимкнено; пункт правого кліку «Convert to HTML» додається завжди). У збірці Microsoft Store саме GUI - запускана точка входу, а подвійний клік по файлу досі запускає конвертер з командного рядка.

Companion-застосунок: FastMediaSorter LITE

Для документів, які є зображеннями, а не текстом - скриншоти, манґа, сфотографовані або відскановані сторінки, те, чого текстовий конвертер прочитати в думках поки не вміє - використовуйте FastMediaSorter LITE, безкоштовний Windows-застосунок для відкриття та сортування зображень і відео з вбудованим OCR та перекладом прямо на зображенні. Натисніть T на будь-якій картинці, щоб розпізнати текст і накласти переклад вашою мовою (локальний Ollama або LibreTranslate). Доповнює Doc-HTML-Translate, який працює з книжковими та текстовими форматами.

winget install SerZhyAle.FastMediaSorter

Завантаження застосунку

Мови інтерфейсу

Інтерфейс застосунку та розширення доступний 13 мовами: en ru uk de it es fr pt ar hi bn ur zh. Англійська, російська та українська вичитані автором; решта десять перекладені машинно й не вичитані - виправлення надсилайте на sza@ukr.net.