LiteParse
LiteParse
применимость 5/5 · Ставить
Что это
Fast document parser от LlamaIndex: пространственное извлечение текста из PDF/DOCX/XLSX/PPTX/images (PDFium + Tesseract OCR), детерминированный, без LLM. ⭐12.1k, Apache-2.0, Rust-ядро, живой.
Чем полезно нам
Шире pdf-inspector (поставлен ранее): тот — только PDF и только text-based; LiteParse — PDF + DOCX/XLSX/PPTX + изображения + встроенный OCR (Tesseract) + bounding boxes + JSON + скриншоты. Для text-based PDF оба дают сопоставимый Markdown; LiteParse берём когда нужен OCR / другие форматы / bbox.
Применимость
В ocr-and-documents / rag-hybrid-retrieval: pdf-inspector для быстрой классификации text-based PDF; LiteParse для OCR / сканов / других форматов.
Связи
Заметки
Стек: [Rust, PDFium, Tesseract]
Факты: Rust, Apache-2.0, создан 2026-02-09, pushed 2026-08-16, ⭐12.1k. В бенчмарке сосед pdf-inspector (0.873 vs 0.875 overall). В заметке UpNote было неверно «через LLM» — на деле детерминированный.
✅ Поставлено 2026-08-16: установлен (uv, v2.13.0), проверен на тех же 3 PDF — с image_mode="off" даёт чистый Markdown с таблицами (заголовки колонок), ~53-75ms.