Daniel Cadeau
Daniel Cadeau
Веб Разработчик

Искусственный интеллект

Использовать ИИ с вашими данными и в ваших инструментах.

Я начинаю с одной конкретной задачи и проверяю её на примере ваших данных до начала разработки. Мы смотрим, что действительно работает и сколько стоит одна обработка.

Что я внедряю

Извлечение данных из документов

Мы определяем, какие данные нужно получить, затем система читает каждый документ и всегда возвращает одну и ту же структуру, например JSON-файл для импорта. Форматы и ожидаемые значения проверяются до отправки в ваш инструмент.

Пример: преобразовать счета поставщиков в строки для импорта в бухгалтерскую систему.

Запросы к документам и базам данных

Вы задаёте вопрос так же, как задали бы его коллеге. В документах векторный поиск находит нужные фрагменты, а ассистент указывает источники. В базе данных он создаёт SQL-запрос только для чтения и превращает результат в понятный ответ. Пользователь видит только те данные, к которым у него есть доступ.

Пример: узнать срок уведомления по договору или получить выручку за квартал по регионам.

За сколько дней нужно предупредить о расторжении основного договора?

Tool Векторный поиск
Основной-договор.pdf#page=120.91
Условия.pdf#page=80.84

По договору нужно предупредить за 60 дней.

Основной-договор.pdf#page=12

Агенты и автоматизация

Ассистент может работать внутри существующего процесса: прочитать запрос, найти информацию в ваших инструментах, вызвать API и передать дело нужному адресату. Разрешённые действия задаются заранее, а после ошибки следующий шаг не запускается.

Пример: прочитать запрос клиента, дополнить его данными из CRM и отправить нужной команде.

Проверить идею до начала разработки

До разработки полного решения я проверяю идею на примере ваших данных. Вы узнаете, что работает, что мешает, сколько стоит одна обработка и не будет ли обычная автоматизация проще. Это позволяет сравнить несколько идей и выбрать или исключить ту, для которой стоит сделать прототип.

От первого теста до продакшена

01
Аудит
Я анализирую задачу на примере ваших данных. Вы получаете вывод о том, что возможно, какие данные нужны, сколько примерно стоит одна обработка и какие более простые решения стоит рассмотреть.
02
Прототип
Я собираю один ограниченный процесс, и мы проверяем его на примерах с известными ответами. Критерии согласуются заранее, поэтому результат помогает решить: продолжать, пересмотреть идею или остановиться.
03
Продакшен
Если тест успешен, я встраиваю решение в ваши инструменты, добавляю необходимые проверки, журналы выполнения и документацию. Вы получаете код и доступы.

Как обрабатываются ваши данные

До выбора модели и хостинга мы решаем, какие данные могут покинуть вашу систему, где они обрабатываются и когда удаляются.

Обработка данных в соответствии со статьёй 28 GDPR

Я обрабатываю ваши данные только для выполнения работы. В договоре указано, какие данные используются, зачем, какие поставщики участвуют в обработке и когда данные удаляются.

Выбрать место обработки

В зависимости от чувствительности документов можно использовать API крупного поставщика, сервис с хостингом в Европе или модель на инфраструктуре под вашим контролем. Этот выбор влияет на стоимость, поддержку и иногда на качество ответов.

Передавать только необходимое

Мы заранее определяем, какие документы и поля нужны модели. Всё остальное не передаётся. Временные файлы, созданные во время обработки, удаляются после завершения процесса.

Вопросы и ответы

Используются ли данные для обучения модели?

+
Нет: это один из критериев выбора. Во время аудита и разработки прототипа я использую сервисы, условия которых исключают обучение моделей на ваших данных. Если проект переходит в продакшен, поставщик и способ размещения выбираются вместе с вами и фиксируются в договоре для этого этапа. Наиболее конфиденциальные документы могут оставаться в инфраструктуре под вашим контролем.

Сколько стоит использование?

+
Есть стоимость разработки и стоимость использования модели. Вторая в основном зависит от объёма обработанного текста. До разработки я измеряю её на примере ваших данных, чтобы дать оценку на основе наблюдаемых результатов.

Какой надёжности можно ожидать?

+
Я не называю показатель надёжности до оценки решения на репрезентативных сценариях. Мы готовим примеры с известным ожидаемым результатом, сравниваем с ним полученные ответы и анализируем ошибки. Так вы можете принять решение на основе измеримых результатов, а не отдельной демонстрации.

Нужно ли много данных для старта?

+
Нет. Для первого теста часто достаточно нескольких десятков типичных документов. Задача не в том, чтобы обучить модель, а в том, чтобы проверить поведение готовой модели на ваших данных.

Какие инструменты вы используете?

+
Я выбираю инструменты с учётом ограничений проекта. Это может быть Ollama для запуска модели на контролируемой инфраструктуре и FastAPI для подключения решения к вашим приложениям. Я также могу использовать технологии, уже применяемые в вашем проекте. Решение можно встроить в существующее приложение или запускать отдельно: выбор зависит от конфиденциальности, объёма, стоимости и сопровождения.

Дополнительное чтение

Я подробно описал настройку RAG-поиска по рабочим документам в статье для блога Les Affluents du Numérique.

Читать статью

Давайте обсудим ваш проект.

Записаться на первый созвон

30 минут, чтобы поговорить о вашем проекте, понять, что вам нужно, и ответить на первые вопросы.