В данной статье рассматриваются архитектурные ограничения больших языковых моделей (LLM), которые делают промпт-инъекции серьезной угрозой. За три года с момента первой инъекции затрачены значительные ресурсы на защиту, однако недавний случай с учеником из Небраски показал, что система все еще уязвима. Он обошел защиту модели и получил инструкции по созданию рицина, добавив смайлик, который модель восприняла как дружелюбный. Проблема заключается в том, что архитектура трансформеров не различает данные и инструкции, что создает условия для атак. Существующие методы защиты не справляются, и необходимость в новом подходе становится все более очевидной. Без принципиально новой архитектуры, которая обеспечит жесткий контроль доступа, проблемы с безопасностью останутся актуальными. Промпт-атаки будут работать, пока мы не изменим подход к контролю и пониманию модели.
