diff --git a/README.md b/README.md index 4a3ee0e..0e5a952 100644 --- a/README.md +++ b/README.md @@ -2,6 +2,8 @@ Обработва help-файлове (`.html`, `.htm`, `.docx`, `.doc`, `.pdf`, `.txt`), декомпозира ги на секции, извлича картинки, класифицира секциите с Claude API (заглавие + ключови думи), и записва всичко в SQL Server. После генерира интерактивен HTML viewer. +**Основен вход в момента:** HTML от Word/LibreOffice „Save as… / уеб страница“ (относителни картинки + H1/H2/MsoNormal структура). PDF и DOCX са вторични. + ## Архитектура ``` @@ -106,7 +108,7 @@ UNIQUE constraint: `(prefix, file_path)` Извличат се по време на парсване: - `.docx` — `` в paragraph drawings → `r:embed` (related_parts) или `r:link` (UNC/`file:///` + sidecar `_media/` до .docx) -- `.html` — локални файлове и `data:` URLs; HTTP пропуска +- `.html` — локални файлове (относителен `src` спрямо HTML папката, вкл. `../` и `%20`) и `data:` URLs; HTTP пропуска; warning при липсващ файл - `.pdf` — `pdfplumber.page.crop(bbox).to_image()` като PNG - `.doc` — след LibreOffice/MS Word конверсия до `.docx` diff --git a/docs/razdeljane-na-sekcii.md b/docs/razdeljane-na-sekcii.md index 09825bf..9a27008 100644 --- a/docs/razdeljane-na-sekcii.md +++ b/docs/razdeljane-na-sekcii.md @@ -61,7 +61,9 @@ TXT и PDF запазват своите правила (номерирани р Без блок „Съдържание“ всяка номерирана глава реже директно. -**Пример (`atra-manual.docx` / NESPERTCAM):** единственото Heading 1 е заглавието на документа; главите 1–9 са Heading 2. Очакване: **10 секции** — преамбюл (title + Съдържание + TOC) + по една за `1.` … `9.`. Не една мега-секция. +`