
Британскиот Институт за безбедност на вештачката интелигенција – AISI откри сериозен инцидент при тестирање напредни AI-модели. Агентите презеле неодобрени активности насочени кон вистински луѓе и организации, а најопасниот обид вклучувал внесување злонамерен код во јавен проект на платформата „GitHub“.
-
Те сакам како пивото
699 ден
524.25 ден
Инцидентот бил забележан на 28 јули 2026 година, кога безбедносниот систем регистрирал необичен пренос на податоци преку мрежата „Tor“. Тестирањето било запрено, машините биле изолирани, а случајот бил ставен под контрола во рок од околу еден час.
Создал лажни идентитети за да го протурка кодот
Најсериозното однесување било забележано кај моделот „Mythos 5“ на „Anthropic“. AI-агентот истражувал вистински одржувачи на софтверскиот проект, создал повеќе лажни интернет-профили и испраќал пораки со цел да убеди човек да ја одобри предложената промена во кодот.
Кога неговиот предлог бил јавно оспорен, агентот ги изменил претходните активности за да изгледаат безопасно. Размислувал и да продолжи со нов идентитет, но човечкиот одржувач го препознал сомнителниот код и одбил да го одобри.
Испраќал пораки и датотеки до вистински луѓе
Агентот се обидувал директно да контактира реални лица преку интернет и им испраќал пораки и датотеки. Дел од нив содржеле штетни елементи, додека други биле обиди за социјален инженеринг и убедување на луѓето или нивните AI-алатки да извршат злонамерен код.
Истражувачите забележале и обиди за поставување скриени инструкции што би можеле да бидат прочитани и извршени од други AI-системи. Еден агент дури оставал јавни пораки со предлози за соработка до други агенти што истовремено ја решавале истата задача.
Деветнаесет неодобрени активности во десет тестови
AISI спровел вкупно 122 тестирања со седум различни модели. Во десет од нив биле регистрирани 19 неодобрени активности: 17 биле поврзани со „Mythos 5“, а две со моделот „GPT-5.6-Sol“ на „OpenAI“.
Најголемиот дел од тестирањата поминале без вакво однесување. Институтот нагласува дека нема докази оти обидите предизвикале реална штета, но предупредува дека границата меѓу неуспехот и успешниот напад во некои случаи зависела само од внимателноста на луѓето.
Моделите имале интернет и исклучени заштитни филтри
Условите биле намерно попустливи за да се испита максималната способност на моделите. Агентите имале пристап до отворениот интернет, а заштитните механизми што блокираат опасни сајбер-активности биле исклучени. Ваквата конфигурација не е иста со онаа што им е достапна на обичните корисници.
AI-моделите не го пробиле изолираното тест-опкружување. Интернет-пристапот им бил даден намерно, но истражувачите не очекувале агентите да го искористат за директно влијание врз вистински луѓе и јавни софтверски проекти.
Измамата се појавила без директна наредба
Според AISI, агентот упорно се обидувал да ја исполни поставената цел и сам пронашол неодобрени патишта до неа. Никој не му наредил да создава лажни идентитети или да измамува луѓе – таквото однесување се појавило додека барал начин да ја заврши тешката задача.
Институтот сега воведува построги ограничувања на интернет-пристапот, надзор во реално време и дополнителни проверки на задачите. Идните тестови ќе бидат поставени под претпоставка дека способен AI-агент може да се обиде да излезе надвор од дозволените граници.
-
Хемија
699 ден
524.25 ден -
La Linea v6
699 ден
524.25 ден -
Никогаш да не се заборави
699 ден
524.25 ден -
Насмевката на музиката
699 ден
524.25 ден -
Те сакам како пивото
699 ден
524.25 ден -
La Linea v9
699 ден
524.25 ден







