API документного интеллекта: PDF, изображения и таблицы превращаются в LLM-готовые данные
Парсит PDF, изображения (PNG/JPEG/TIFF), документы Word, таблицы (CSV/XLSX), PowerPoint и сканы, поддерживая около 100 языков; выполняет OCR, определяет раскладку и порядок чтения, отдаёт bounding box и ссылки на источник (citations); извлекает данные по заданной схеме; справляется с рукописным текстом, формами, математическими формулами, таблицами, графиками и техническими схемами. Работа построена вокруг простого task-based API с вебхуками; есть Python- и TypeScript-библиотеки и веб-интерфейс для тестовых запусков.
| Ставится в | python-sdk, typescript-sdk, rest-api, web |
| Тип | API |
| Категория | Данные и аналитика / API документного интеллекта |
| Цена | есть бесплатный тариф |
| Системы | api, web, on-premise |
| Хостинг | hybrid |
| Ставится в | python-sdk, typescript-sdk, rest-api, web |
| Для кого | Разработчики и AI-команды, строящие RAG-конвейеры и обработку сложных документов |
| Язык сайта | en |
| Вендор | Chunkr (Lumina AI) |
| GitHub | lumina-ai-inc/chunkr |