Работа с PDF: как задавать вопросы документу
Загрузите договор, отчёт или исследование — и спросите его напрямую. Объясняем, как ИИ «читает» PDF, какие вопросы работают лучше всего и как проверять ответы.
Дмитрий Орлов
ML-инженер
Раздел «Документы» в Haar AI превращает PDF, DOCX и таблицы в собеседника: вы задаёте вопрос — модель отвечает со ссылками на конкретные страницы. Разберёмся, как это устроено и как получать точные ответы.
Как модель «читает» документ
Документ разбивается на фрагменты, и каждый фрагмент индексируется по смыслу. Когда вы задаёте вопрос, система находит самые подходящие фрагменты и передаёт их модели вместе с вопросом. Этот подход называется RAG — генерация с опорой на найденные источники.
Отсюда два следствия:
- модель отвечает по тексту документа, а не «из головы», — поэтому ответы можно проверить;
- если нужной информации в файле нет, хорошая модель так и скажет.
Какие вопросы работают лучше
Правило простое: чем конкретнее вопрос, тем точнее найденные фрагменты.
Сценарии, которые экономят часы
- Юристы сравнивают две редакции договора и получают список изменений.
- Аналитики переносят таблицы из годовых отчётов в Excel.
- Студенты и исследователи просят объяснить сложный раздел статьи простыми словами.
- HR-специалисты загружают резюме пачкой и ищут кандидатов с нужным опытом.
Пример: договор аренды за четыре минуты
Мы загрузили договор аренды офиса на 42 страницы и задали три вопроса подряд:
- «Какие платежи, кроме аренды, обязан вносить арендатор?» — модель перечислила эксплуатационные расходы, коммунальные платежи и страховой депозит со ссылками на пункты 4.2, 4.5 и 6.1.
- «Можно ли расторгнуть договор досрочно и чем это грозит?» — ответ с цитатой: уведомление за три месяца и потеря депозита.
- «Сведи всё в таблицу для руководителя» — готовая таблица, которую осталось вставить в письмо.
На всё ушло четыре минуты и 12 кредитов — юрист потратил бы на это не меньше часа.
Как проверять ответы
Каждый ответ сопровождается цитатами со ссылками на страницы. Кликните по ссылке — и документ откроется в нужном месте. Если цитаты нет, переформулируйте вопрос или попросите: «ответь только по тексту документа и приведи цитату».
Для длинных документов — от 300 страниц — выбирайте Model C: её контекст вмещает до миллиона токенов, поэтому она видит документ целиком, а не только найденные фрагменты.
Ограничения и приватность
- Сканы без текстового слоя распознаются автоматически, но качество зависит от чёткости исходника.
- На тарифе Pro можно загружать файлы до 100 МБ.
- Документы хранятся в зашифрованном виде и не используются для обучения моделей. Удалить файл можно в любой момент — вместе со всеми индексами.