.
This commit is contained in:
@@ -2,6 +2,8 @@
|
||||
|
||||
Обработва help-файлове (`.html`, `.htm`, `.docx`, `.doc`, `.pdf`, `.txt`), декомпозира ги на секции, извлича картинки, класифицира секциите с Claude API (заглавие + ключови думи), и записва всичко в SQL Server. После генерира интерактивен HTML viewer.
|
||||
|
||||
**Основен вход в момента:** HTML от Word/LibreOffice „Save as… / уеб страница“ (относителни картинки + H1/H2/MsoNormal структура). PDF и DOCX са вторични.
|
||||
|
||||
## Архитектура
|
||||
|
||||
```
|
||||
@@ -106,7 +108,7 @@ UNIQUE constraint: `(prefix, file_path)`
|
||||
|
||||
Извличат се по време на парсване:
|
||||
- `.docx` — `<a:blip>` в paragraph drawings → `r:embed` (related_parts) или `r:link` (UNC/`file:///` + sidecar `<stem>_media/` до .docx)
|
||||
- `.html` — локални файлове и `data:` URLs; HTTP пропуска
|
||||
- `.html` — локални файлове (относителен `src` спрямо HTML папката, вкл. `../` и `%20`) и `data:` URLs; HTTP пропуска; warning при липсващ файл
|
||||
- `.pdf` — `pdfplumber.page.crop(bbox).to_image()` като PNG
|
||||
- `.doc` — след LibreOffice/MS Word конверсия до `.docx`
|
||||
|
||||
|
||||
Reference in New Issue
Block a user