Руководство пользователя: Интеграция и эксплуатация конвейера «ДокСинтез»

2026/09/03

Инженерная служба ДокСинтез

Данное руководство предназначено для специалистов финансово-бухгалтерской службы и системных администраторов компаний, которые уже приобрели решение «ДокСинтез» и настраивают регулярный процесс обработки первичной документации (УПД, акты, накладные, счета).

Ниже представлена интерактивная презентация конвейера, а далее — подробное описание разделения файлов исходных данных, конфигурации каталогов и регламента работы.

ДокСинтез: Автономная обработка первичных документов
Общий регламент и сквозной конвейер обработки
Преодоление Семантического хаоса в номенклатуре
Архитектура без права на ошибку: Тандем LLM и программного аудита
Ключевые преимущества двойной математической верификации
Архитектура безопасности: 100% изоляция в корпоративном контуре
Аппаратные требования для локального развертывания
Гибридный нейросетевой конвейер
Шаг 1-2: Развертывание сервера Ollama и регистрация моделей
Шаг 3-4: Настройка среды Python и запуск конвейера
Шаг 5: Ночная автоматизация Свежий отчет к завтраку

1. Структура исходных Excel-файлов для DokSintez.py

Для работы конвейера используются два отдельных Excel-файла: файл справочных данных (словарей) и файл шаблона отчета.

1.1. Файл справочных данных (contracts_path, например: Исходные данные для отчета.xlsx)

Этот файл содержит эталонные справочники компании, выступающие в роли жестких ограничителей (Guardrails) для локальной нейросети. Он включает следующие вкладки (листы):

  1. Лист «Контрагенты»:
    • Колонки: Наименование компании, Оплата (условия постоплаты/отсрочки), Номер и дата Договора.
    • Обеспечивает нормализацию написания поставщиков (например, если в УПД указано «Индивидуальный предприниматель Башмаков А.В.», система автоматически сопоставит его с канонической записью «ИП Башмаков»).
  2. Лист «Статьи бюджета»:
    • Колонки: Наименование компании, Статья в бюджете / доп. работы.
    • Закрепляет официальный корпоративный классификатор затрат компании (например: «Клининг и санитарно-гигиеническое обслуживание», «Представительские расходы», «Хозяйственный инвентарь»).
  3. Лист «Бюджет»:
    • Колонки: Наименование компании, Статья в бюджете / доп. работы, Сумма по бюджету в валюте договора с Заказчиком, Номер РО от клиента.
    • Содержит утвержденные лимиты, ставки и действующие заказы-соглашения (PO).
  4. Лист «Сортировка» (опционально):
    • Список статей бюджета в строго определенном порядке, в котором строки должны группироваться в итоговом реестре.

1.2. Файл шаблона отчета (example_path, например: Шаблон отчета по подрядчикам.xlsx)

Отдельная эталонная книга Excel, которая:

  • Содержит готовую шапку таблицы, формулы, правила оформления, границы и форматы чисел (начиная со строки 11).
  • Служит источником примеров проверенных человеком сопоставлений (Few-shot examples), автоматически считываемых скриптом для контекстного обучения модели.
  • Используется как основа: скрипт копирует шаблон и заполняет его обработанными строками с сохранением всех стилей.

2. Организация рабочих каталогов и поставка документов

Для надежной и прозрачной работы рекомендуется настроить три независимых каталога:

├── 📁 reference_data/          # Сетевая папка с эталонными Excel-файлами (SharePoint / SMB)
│   ├── Исходные данные для отчета.xlsx
│   └── Шаблон отчета по подрядчикам.xlsx
├── 📁 incoming_docs/           # Папка входящей первички (УПД, акты, счета в PDF)
│   ├── UPD_Vendor1_0023.pdf
│   └── Act_Service_9812.pdf
└── 📁 output_reports/          # Папка готовых верифицированных отчетов
    └── Отчет_Сверка_2026-09-03.xlsx
  • Папка входящих документов (incoming_docs / source_folder): Бухгалтеры и делопроизводители в течение дня сохраняют сюда поступающие PDF-файлы (УПД, акты, накладные, счета на оплату, приложения и доп. соглашения).
  • Папка итоговых отчетов (output_reports / output_path): Скрипт автономно считывает входящие PDF, извлекает таблицы, сопоставляет номенклатуру со справочниками, пересчитывает суммы по правилу «Количество (из УПД) × Цена за единицу (по PO)» и формирует готовый Excel-отчет с цветовой маркировкой статусов и комментариями по расхождениям.

3. Настройка параметров скрипта DokSintez.py

Скрипт DokSintez.py принимает пути к файлам и каталогам в качестве параметров функции generate() и аргументов командной строки.

Важно для системного администратора: Перед первым запуском откройте файл DokSintez.py и скорректируйте пути по умолчанию в блоке инициализации под структуру каталогов вашего сервера:

# Настройка путей по умолчанию в DokSintez.py:
gen = DokSintez(ollama_url="http://127.0.0.1:11434", model="bigbang:v1")
gen.generate(
    source_folder="/mnt/share/incoming_docs",
    contracts_path="/mnt/share/reference_data/Исходные данные для отчета.xlsx",
    example_path="/mnt/share/reference_data/Шаблон отчета по подрядчикам.xlsx",
    output_path="/mnt/share/output_reports/Отчет_Сверка.xlsx",
    test_mode=False
)

4. Памятка для системного администратора

Аппаратные требования:

  • Процессор (CPU): Обязательна поддержка инструкций AVX2 (Intel Core i7/i9 8+ gen, AMD Ryzen 7/9, Intel Xeon / AMD EPYC).
  • Оперативная память (RAM): 32 ГБ — критический минимум для стабильного удержания локальной квантованной модели в памяти и работы с широким контекстным окном многостраничных PDF (рекомендуется 64 ГБ).
  • Накопитель: Скоростной NVMe SSD для быстрой загрузки весов моделей и работы с PDF.
  • GPU (опционально): NVIDIA RTX (от 8–16 ГБ VRAM) или Apple Silicon Mac (M-серия с 32+ ГБ объединенной памяти) ускоряют обработку в 3–5 раз.

Рекомендации по сетевой инфраструктуре:

  1. Справочники — в общую папку: Разместите каталог с исходными Excel-файлами (reference_data/) в корпоративной сетевой папке (SharePoint, Nextcloud, Samba/SMB share), чтобы бухгалтерия могла оперативно обновлять реестры PO и договоров.
  2. Разделение каталогов: Папка входящих PDF (incoming_docs) и папка итоговых отчетов (output_reports) должны быть изолированы друг от друга и от справочных файлов во избежание путаницы или случайного удаления.
  3. Пошаговая установка компонентов: Подробная инструкция по установке сервера Ollama, импорту GGUF-моделей (GLM-OCR, BigBang-v1) и созданию виртуального окружения Python доступна в статье: 👉 Полное руководство по установке и автономному запуску конвейера «ДокСинтез».

5. Регламент «Свежий отчет к завтраку» (Nightly Runs)

При настройке регулярного запуска по расписанию (через cron в Linux или Планировщик заданий / Task Scheduler в Windows) процесс для сотрудников выглядит максимально бесшовно:

  1. В течение рабочего дня: Бухгалтеры в штатном режиме складывают поступающие закрывающие документы в общую сетевую папку incoming_docs.
  2. Ночью (например, в 02:00): Сервер автоматически запускает DokSintez.py. Без участия человека выполняются оптическое распознавание таблиц, семантический маппинг строк и математический аудит цен и ставок НДС.
  3. Утром к 09:00: Руководитель финансового отдела и главный бухгалтер открывают свежий отчет в папке output_reports. Все документы, поступившие за предыдущий день, уже разнесены по бюджетам, а любые превышения лимитов или расхождения в ставках подсвечены для точечного контроля.

Контакты инженерной поддержки

По техническим вопросам интеграции и оптимизации параметров скрипта под ваши объемы документов: