LiteParse

LiteParse

ai · Ставить · применимость 5/5

LiteParse

применимость 5/5 · Ставить

Что это

Fast document parser от LlamaIndex: пространственное извлечение текста из PDF/DOCX/XLSX/PPTX/images (PDFium + Tesseract OCR), детерминированный, без LLM. ⭐12.1k, Apache-2.0, Rust-ядро, живой.

Чем полезно нам

Шире pdf-inspector (поставлен ранее): тот — только PDF и только text-based; LiteParse — PDF + DOCX/XLSX/PPTX + изображения + встроенный OCR (Tesseract) + bounding boxes + JSON + скриншоты. Для text-based PDF оба дают сопоставимый Markdown; LiteParse берём когда нужен OCR / другие форматы / bbox.

Применимость

В ocr-and-documents / rag-hybrid-retrieval: pdf-inspector для быстрой классификации text-based PDF; LiteParse для OCR / сканов / других форматов.

Связи

IT-WO Core

Заметки

Стек: [Rust, PDFium, Tesseract]

Факты: Rust, Apache-2.0, создан 2026-02-09, pushed 2026-08-16, ⭐12.1k. В бенчмарке сосед pdf-inspector (0.873 vs 0.875 overall). В заметке UpNote было неверно «через LLM» — на деле детерминированный.

✅ Поставлено 2026-08-16: установлен (uv, v2.13.0), проверен на тех же 3 PDF — с image_mode="off" даёт чистый Markdown с таблицами (заголовки колонок), ~53-75ms.