Prompt injection – yəni hücumçuların böyük dil modellərini (LLM) aldatmaq üçün məzmuna yerləşdirdiyi zərərli əmrlər – uzun müddətdir ki, AI platformalarını istifadəçilərinə qarşı yönəltmək üçün ən geniş istifadə olunan üsullardan biridir. E-poçt və ya təqvim dəvətinə gizlədilmiş yaxşı hazırlanmış bir əmr çox vaxt modelin məxfi məlumatları sızdırmasına və ya digər zərərli əmrləri yerinə yetirməsinə səbəb olur.
Lakin indi müdafiə tərəfi də bu yanaşmadan istifadə etməyə başlayıb.
Tracebit şirkətinin tədqiqatçıları bildiriblər ki, Amazon Web Services (AWS) mühitində saxlanılan parolların, kriptoqrafik açarların və digər məxfi məlumatların yanına xüsusi prompt injection sətirləri yerləşdirmək AI əsaslı hücumların qarşısını almaqda olduqca effektivdir.
Bu əmrlər hücum edən LLM-i onun təhlükəsizlik qaydalarına zidd olan hərəkətlər etməyə məcbur edir. Model belə qadağan olunmuş əmrlə qarşılaşdıqda təhlükəsizlik mexanizmi işə düşür və fəaliyyətini dayandırır.
Buna misal olaraq modeldən inhalyasiya edilə bilən Anthrax sporlarının hazırlanmasını izah etməsini tələb edən və ya bəzi Çin mənşəli LLM-lər üçün 1989-cu il Tiananmen Meydanı hadisələrinin simvolu olan Tank Man haqqında məlumat verməsini istəyən əmrlər göstərilir. Model bu cür qadağan edilmiş göstərişlərlə qarşılaşdıqda əvvəlki tapşırıqları yerinə yetirməyi dayandırır.
Tədqiqatçılar bu üsulu Context Bombing adlandırırlar.
Tracebit-in həmtəsisçisi və baş direktoru Andy Smith bildirib ki, bu metod modelin kontekstində güclü və ani təsir yaradır. Model həmin əmri qəbul etdikdən sonra sonrakı tapşırıqları da yerinə yetirməkdən imtina etməyə davam edir.
Şirkətin ilkin testləri göstərib ki, Context Bombing olduqca perspektivli müdafiə üsuludur. Tədqiqat zamanı Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro və Kimi 2.6 modelləri sınaqdan keçirilib. Modellər simulyasiya edilmiş AWS mühitində müxtəlif inkişaf etdirici tapşırıqlarını yerinə yetirərkən gizlədilmiş bu xüsusi sətirlərlə qarşılaşıblar.
152 sınaq nəticəsində məlum olub ki, saxta məxfi məlumatın içinə yalnız bir belə sətirin yerləşdirilməsi AI agentlərinin tam administrator səlahiyyətləri əldə etmə ehtimalını 57%-dən 5%-ə, tam sistem komprometasiya ehtimalını isə 36%-dən cəmi 1%-ə endirib.
Ən güclü model hesab edilən Opus 4.8 isə əvvəlki testlərdə halların 93%-də administrator hüquqları əldə etdiyi halda, Context Bombing ilə qarşılaşdıqdan sonra bütün sınaqlarda uğursuz olub