ИИ путается, когда план, разрез и фасад — это один и тот же узел здания
Обычные модели компьютерного зрения, работающие с несколькими ракурсами одного объекта (например, разными кадрами видео), исходят из простого правила: изменение внешнего вида объекта объясняется движением камеры. Архитектурные чертежи это правило ломают: план и разрез — это сечения здания, а фасад — плоская проекция, и один и тот же элемент выглядит на них принципиально по-разному не из-за ракурса, а из-за самой природы чертежа.
Исследователи создали CrossProjection — тест, проверяющий, удерживает ли ИИ «личность» одного и того же элемента (например, конкретной колонны или окна), сопоставляя план, разрез и фасад между собой. На 23 наборах чертежей и почти 2000 тестовых условиях лучшая модель (GPT-4.5) угадывала правильный элемент в 82% случаев — заметно, но не безупречно; более слабые модели держали 57–62%. Люди на той же задаче показывали 87–93%.
Хуже всего дела обстоят с точной геометрической локализацией — не просто «угадать какой это элемент», а точно указать его координаты на чертеже. У лучшей модели точность падала до 54–76%, у слабых — вплоть до 8–10%. Вывод авторов: то, что модель верно выбирает элемент из вариантов, ещё не значит, что она надёжно понимает его точное положение в пространстве, — а именно точные координаты и нужны для реальной работы с BIM.
Сигнал
Честный тест на слепую зону современных ИИ: распознать элемент чертежа по смыслу — не то же самое, что точно определить его координаты, а для BIM важна именно вторая способность.
Шум
Это диагностический бенчмарк, не готовый инструмент — он показывает проблему, но не решает её.
Термины из этой записи