Что сделано
Разобрались, почему на чертежах ТВ и радио плохо считывались количества
На исполнительных схемах радио автоматическое чтение «Ведомости объёмов работ и материалов» давало лишь около 30% верных строк, а на ТВ часть таблицы вообще обрезалась. Раньше это списывали на «неудобный шрифт чертежа». Провели честную диагностику на реальных документах и нашли настоящую причину.
- Сама таблица «Ведомость объёмов» на этих чертежах нарисована линиями (как картинка), а не текстом — поэтому её может прочитать только распознавание по изображению (Vision AI). Это подтвердилось на реальных файлах.
- Ключевое: узкая колонка «Кол-во» на картинке, которую мы отправляли в AI, замыливалась при уменьшении — и цифра «5» читалась как «1». То есть проблема была не в «уме» модели, а в разрешении картинки, которую ей давали.
Исправление: разрезаем зону ведомости на полосы высокого разрешения
Вместо одной широкой картинки теперь зона ведомости отправляется в AI несколькими перекрывающимися горизонтальными полосами во всю ширину. Каждая строка попадает в кадр крупно и читается чётко, а полосы вместе покрывают всю таблицу — поэтому таблица не обрезается, даже если на разных чертежах она расположена по-разному.
- Проверено на двух реальных чертежах — радио и ТВ: с ~30% (и обрезки на ТВ) до примерно 90% верных позиций.
- Дополнительно поправлено чтение таблицы «Ведомость технологических отверстий» — колонка количества отверстий теперь считывается (раньше терялась).
- Всё это работает на той же AI-модели, что и раньше — без нового поставщика.
Проверили и отклонили два альтернативных пути (чтобы не тратить время впустую)
- Отдельный «движок чтения документов» (MinerU) — оценили и не внедряем: он бы упёрся в ту же проблему (таблица нарисована линиями) и требует тяжёлой инфраструктуры.
- Переход на иностранную AI-модель для распознавания — рассматривали, но отказались: настоящая причина была в разрешении картинки, а не в модели. Смена модели ничего бы не дала, зато добавила бы зависимость от зарубежного сервиса и вопросы по хранению данных. Оставили текущую модель.
Также попробовали и отложили экспериментальный «текстовый» разбор таблиц: он полезен только для тех чертежей, где ведомость сделана настоящим текстом, — сохранён на будущее, в основной продукт пока не идёт.
Решения
- Настоящий рычаг качества здесь — разрешение картинки, отправляемой в распознавание, а не выбор AI-модели. Это и было исправлено.
- Иностранную модель и отдельный движок чтения — не внедряем. Обоснование зафиксировано, чтобы не переоценивать заново.
- Результат подтверждён на реальных чертежах до внесения в продукт.
Что дальше
- Проверить исправление на живом прогоне через интерфейс на новой схеме.
- Несколько самых мелких цифр на радийном чертеже всё ещё иногда требуют подтверждения сметчиком — для этого и сделано пошаговое подтверждение каждой строки; при накоплении новых документов от сметчика точность донастраивается.
Расход часов
- Диагностика причины на реальных чертежах, проверка альтернатив (движок чтения, иностранная модель) — ~2 ч
- Прототип и проверка разрезания на полосы, продуктизация в основном коде, проверка на двух чертежах — ~3 ч
Итого: 5 ч (ставка 4 200 ₽/ч, −30% от рынка).