Çinin “Moonshot AI” şirkətinin süni intellekt modellərində təhlükəsizlik baryerlərinin mürəkkəb “jailbreak” üsulu ilə aşılması süni intellekt sənayesində əsas problemin artıq yalnız modellərin nə qədər güclü olması deyil, onların təhlükəli istifadədən nə dərəcədə etibarlı qoruna bilməsi olduğunu göstərir. Böyük Britaniyanın “Mindgard” şirkətinin apardığı təhlükəsizlik testlərində “Kimi” modellərinin bəzi zərərli sorğulara qarşı qoruyucu mexanizmləri keçə bildiyi bildirilib. “Mindgard”ın açıqlamasına görə, testlər iyul ayında aparılıb, nəticələr iyulun 27-də “Moonshot AI”yə təqdim edilib və araşdırmanın detalları sentyabrda açıqlanıb.
Burada vacib məqam konkret bir modelin “təhlükəli” elan edilməsi deyil. Problem süni intellekt sistemlərinin qarşısına qoyulan təhlükəsizlik qaydalarının istifadəçinin xüsusi hazırlanmış sorğuları vasitəsilə yan keçilə bilməsidir. “Jailbreak” adlandırılan yanaşmalar modelin ilkin təhlükəsizlik təlimatları ilə istifadəçinin verdiyi göstərişlər arasında ziddiyyət yaratmağa və sistemi nəzərdə tutulmayan cavab vermə rejiminə keçirməyə çalışır. “Mindgard” öz testlərinin nəticələrində “Kimi”nin bioloji silahlar, zərərli proqram təminatı, partlayıcılar və hədəfli zorakılıqla bağlı yüksək riskli məzmun yaratdığını bildirib. Şirkət reproduksiya üçün lazım olan konkret “jailbreak” təlimatlarını isə açıqlamayıb.
Bu hadisəni daha geniş tendensiyadan ayırmaq çətindir. 2026-cı il Beynəlxalq Süni İntellekt Təhlükəsizliyi Hesabatında qeyd olunur ki, qabaqcıl ümumi təyinatlı modellərin bioloji və kimyəvi silahların hazırlanması ilə əlaqəli bəzi texniki tapşırıqlarda imkanları əhəmiyyətli dərəcədə yüksəlib. Hesabatda bəzi modellərin müvafiq testlərdə ekspert səviyyəsinə yaxınlaşdığı və ya onu keçdiyi, lakin bunun real dünyada silah hazırlanmasını avtomatik olaraq mümkün etmədiyi xüsusi vurğulanır. Avadanlıq, material, laboratoriya və digər praktiki maneələr hələ də ciddi məhdudiyyət olaraq qalır.
Bu fərq xüsusilə əhəmiyyətlidir. Süni intellekt modelinin təhlükəli mövzuda məlumat verə bilməsi ilə həmin məlumatdan real həyatda təhlükəli nəticə əldə etmək eyni şey deyil. Buna görə də təhlükəsizlik araşdırmalarında yalnız “model nə deyə bilir?” sualı deyil, “bu imkan istifadəçinin real fəaliyyətini nə qədər asanlaşdırır?” sualı da ön plana çıxır. Beynəlxalq hesabatın özündə də müxtəlif tədqiqatların real istifadəçilərə verdiyi əlavə fayda ilə bağlı nəticələrin hələ tam yekdil olmadığı qeyd edilir.
Lakin riskin digər tərəfi süni intellekt agentlərinin getdikcə daha çox alətə çıxış əldə etməsidir. Sadə çat-bot yalnız mətn yaradırsa, agent sistemi kod yaza, fayllarla işləyə, internetdən məlumat əldə edə və müəyyən proqram təminatını idarə edə bilər. Belə sistemlərdə təhlükəsizlik baryerinin aşılması ilə yanaşı, modelə verilmiş icazələrin həddi də kritik əhəmiyyət daşıyır. “Mindgard” da öz araşdırmasında təhlükəsizlik probleminin xüsusilə modellər avtonom kodlaşdırma və agent sistemlərinə inteqrasiya edildikdə böyüdüyünü vurğulayır.
Bu səbəbdən “Moonshot AI” ilə bağlı məsələni yalnız məzmun filtrlərinin problemi kimi qiymətləndirmək kifayət deyil. Əgər modelin internet bağlantısı, kod icrası və ya xarici sistemlərlə qarşılıqlı əlaqəsi varsa, təhlükəsizlik arxitekturası bir neçə səviyyədən ibarət olmalıdır. Modelin zərərli sorğunu rədd etməsi birinci müdafiə xəttidir. İcazələrin məhdudlaşdırılması, xarici sistemlərə çıxışın nəzarətdə saxlanılması, əməliyyatların monitorinqi və şübhəli davranışların avtomatik aşkarlanması isə sonrakı qatları təşkil edir.
Beynəlxalq Süni İntellekt Təhlükəsizliyi Hesabatının nəticələri də məhz bu istiqamətə işarə edir. Hesabatda qeyd olunur ki, qabaqcıl modellərin təhlükəsizlik testlərindən yayınmaq və test mühiti ilə real istifadə mühiti arasındakı fərqlərdən yararlanmaq qabiliyyəti artır. Bu isə modelin buraxılışdan əvvəl keçirilən standart testlərdə təhlükəsiz görünməsinin onun real istifadə şəraitində eyni davranacağına zəmanət vermədiyini göstərir.
Sənayedə buna cavab olaraq “red teaming”, təhlükəli imkanların ayrıca qiymətləndirilməsi və “Frontier AI Safety Frameworks” kimi mexanizmlər genişlənir. 2026-cı il hesabatına əsasən, bir sıra aparıcı şirkətlər bioloji, kimyəvi və kiber risklər üçün əvvəlcədən müəyyən edilmiş təhlükə hədləri tətbiq edir. Bəzi çərçivələrdə model müəyyən imkan səviyyəsinə çatdıqda əlavə təhlükəsizlik tədbirlərinin tətbiqi, girişlərin məhdudlaşdırılması və ya yerləşdirmənin dayandırılması kimi mexanizmlər nəzərdə tutulur.
Burada iqtisadi tərəf də kifayət qədər əhəmiyyətlidir. Süni intellekt şirkətləri üçün təhlükəsizlik artıq yalnız texniki və etik məsələ deyil, həm də kommersiya riskidir. Modelə etibarın azalması korporativ müştərilərin daha sərt təhlükəsizlik tələbləri irəli sürməsinə, sığorta və uyğunluq xərclərinin artmasına, şirkətlərin əlavə monitorinq sistemlərinə investisiya qoymasına səbəb ola bilər. Xüsusilə maliyyə, səhiyyə, enerji, müdafiə və dövlət xidmətləri kimi sahələrdə AI agentlərinin tətbiqi genişləndikcə, modelin imkanları ilə yanaşı, onun hansı resurslara çıxışının olduğu da müqavilələrin və risk qiymətləndirmələrinin əsas hissəsinə çevrilir.
Son dövrdə bu risklərin yalnız nəzəri xarakter daşımadığına dair daha geniş sübutlar da toplanır. Beynəlxalq hesabatda real kiberhücumlarda süni intellektdən istifadə ilə bağlı sübutların artdığı qeyd olunur. Reuters-in sentyabrda yaydığı araşdırmada isə Çin şirkətlərinin, o cümlədən “Moonshot”un modelləri ilə işləyən AI agentlərində məhdudiyyətlərdən yayınma və aldadıcı davranışlarla bağlı müxtəlif sınaq nəticələrindən bəhs edilir. Bununla belə, bu davranışların böyük hissəsinin hələ də nəzarətli test mühitlərində müşahidə edildiyini nəzərə almaq lazımdır.
Azərbaycan kimi rəqəmsal transformasiyanı sürətləndirən ölkələr üçün bu tendensiyanın praktik əhəmiyyəti də var. Süni intellektin dövlət xidmətlərində, maliyyə sektorunda, biznes proseslərində və sənaye müəssisələrində istifadəsi genişləndikcə, təhlükəsizlik standartlarının texnologiyanın tətbiqindən sonra deyil, layihələndirmə mərhələsindən etibarən qurulması vacib olacaq. Xüsusilə xarici AI platformalarından istifadə zamanı məlumatların harada emal edilməsi, hansı sistemlərə çıxış verilməsi və modelin yaratdığı nəticələrin insan tərəfindən yoxlanılması kimi məsələlər texniki tələbdən daha çox idarəetmə standartına çevrilə bilər.
“Moonshot AI” ətrafında yaranan vəziyyətin əsas mesajı buna görə də daha genişdir: süni intellekt modellərinin inkişaf sürəti təhlükəsizlik mexanizmlərinin inkişaf sürətini qabaqladıqda, ən güclü model belə etibarlı sistem anlamına gəlmir. “Jailbreak” üsullarının davamlı şəkildə təkmilləşməsi isə müdafiənin birdəfəlik qurulan filtr deyil, daim yenilənən proses olmasını tələb edir. Beynəlxalq ekspertlərin qiymətləndirməsinə görə, mövcud risklərin idarə olunması mexanizmləri inkişaf etsə də, onların effektivliyində hələ ciddi boşluqlar qalır.
Nəticədə, “Moonshot AI” ilə bağlı araşdırma süni intellekt yarışında yeni mərhələnin əsas göstəricilərindən birini ortaya qoyur. Artıq bazarda üstünlük yalnız daha böyük, daha sürətli və daha ağıllı model yaratmaqla ölçülməyəcək. Modelin zərərli istifadəyə qarşı dayanıqlığı, agent kimi fəaliyyət göstərərkən hansı sərhədlər daxilində işləməsi və təhlükəsizlik mexanizmlərinin real hücumlar qarşısında nə qədər davamlı olması da onun texnoloji dəyərinin mühüm hissəsinə çevrilir. Bu isə gələcək AI iqtisadiyyatında “təhlükəsizliyə investisiya”nı əlavə xərcdən daha çox, məhsulun etibarlılığını müəyyən edən əsas infrastruktur elementinə çevirir.
Nuray,
AzNews.az