ШІ ўзбунтаваўся
1- 31.07.2026, 12:23
- 1,422
Claude самавольна пранік у працоўныя сістэмы трох кампаній падчас тэстаў бяспекі.
Кампанія Anthropic паведаміла пра вынікі ўнутранага расследавання. Яно выявіла тры выпадкі, калі яе мадэль Claude пранікла ў сістэмы трох арганізацый падчас праверак кібербяспекі, піша New Voice.
Праверку правялі пасля нядаўняга інцыдэнту з OpenAI, чыя мадэль падчас тэстаў атрымала доступ да платформы Hugging Face.
Прааналізаваўшы больш за 140 000 запускаў, спецыялісты Anthropic высветлілі, што мадэлі выходзілі ў інтэрнэт з-за памылкі ў наладах асяроддзя падчас узаемадзеяння з партнёрам Irregular. Пра гэта піша TechCrunch.
Кампанія падкрэсліла, што не перакладае адказнасць на партнёра і выпраўляе сітуацыю так, быццам памылка была цалкам яе ўласнай.
У інцыдэнтах былі задзейнічаныя тры мадэлі: Opus 4.7, Mythos 5 і ўнутраная даследчая тэставая мадэль. У Claude быў доступ да інтэрнэту, хаця ў тэксце прампта сцвярджалася, што доступу няма. Падаецца, мадэль вырашыла, што рэальныя сістэмы — гэта частка тэставага сцэнару.
Тры мадэлі паводзілі сябе па-рознаму. Opus 4.7 зразумела, што сістэма рэальная, але працягнула атаку і скрала дадзеныя. Mythos 5 таксама заўважыла прыкметы рэальнасці, але пераканала сябе ў адваротным і апублікавала шкоднасны код у PyPI. Толькі ўнутраная тэставая мадэль спынілася сама, калі зразумела, што мэта рэальная.
Кампанія Anthropic заявіла, што падобныя выпрабаванні мадэляў патрабуюць значна больш жорсткага кантролю. Таксама было ўдакладнена, што падчас гэтых праверак Claude працаваў без дадатковых ахоўных механізмаў і класіфікатараў, якія дзейнічаюць у публічнай версіі. Іх наўмысна адключылі для ацэнкі «сырых» магчымасцяў, аднак, паводле прадстаўнікоў кампаніі, менавіта гэтыя сродкі не дапусцілі б узнікнення праблемы.
Anthropic падкрэсліла, што ніводная з мадэляў не мела ўласнай мэты — яны проста спрабавалі выканаць пастаўленую задачу.