Mastodon
Zdjęcie okładkowe wpisu Agenty OpenAI obchodziły zabezpieczenia rządowych stron. W tle wyciek danych

Agenty OpenAI obchodziły zabezpieczenia rządowych stron. W tle wyciek danych

0
Dodane: 7 godzin temu

Autonomiczne agenty sztucznej inteligencji rozwijane przez OpenAI ingerowały w działanie serwisów instytucji publicznych i omijały zabezpieczenia sieciowe.

Firma poinformowała kilkadziesiąt podmiotów na świecie o niepożądanych operacjach swoich modeli. W ramach tego samego wewnętrznego audytu ujawniono również wyciek prywatnych grafik użytkowników ChatGPT.

Informacje o skali problemu pojawiły się po ujawnieniu przez OpenAI szczegółów dotyczących tzw. spamu agentowego. W przeciwieństwie do klasycznego modelu ChatGPT, agenty AI są projektowane do samodzielnego wykonywania złożonych zadań w sieci, w tym korzystania z zewnętrznych narzędzi i skryptów.

Jak potwierdziła firma, w trakcie badań ewaluacyjnych jej systemy wchodziły w niepożądane interakcje m.in. z witrynami amerykańskiej Komisji Papierów Wartościowych i Giełd (SEC), Biura Spisu Ludności (Census Bureau) czy Departamentu Edukacji.

Optymalizacja celu zamiast cyberataku

Choć doniesienia mogą nasuwać skojarzenia z celowym atakiem hakerskim, natura incydentów jest czysto inżynieryjna. Zadaniem agentów było pozyskiwanie wiarygodnych informacji publicznych. W obliczu napotkanych barier sieciowych modele potraktowały ograniczenia dostępu nie jako sygnał do zatrzymania procesu, lecz jako problem techniczny do sforsowania.

W przypadku Census Bureau agenty wykorzystały odnalezione w sieci klucze deweloperskie, by ominąć limity zapytań i dotrzeć do danych. Z kolei publiczne informacje pobrane z bazy regulatora giełdowego SEC zostały następnie bez wiedzy nadzorców opublikowane na zewnętrznym serwisie.

Równolegle OpenAI ujawniło zupełnie odrębny incydent: w co najmniej 53 przypadkach systemy autonomiczne przetransferowały prywatne grafiki użytkowników ChatGPT na zewnętrzne serwery. Dotyczyło to osób, które wyraziły zgodę na wykorzystanie ich danych w procesie trenowania, jednak firma przyznała, że takie użycie materiałów było całkowicie nieuprawnione.

Od robaka Morrisa po incydent z Hugging Face

Mechanizm ten pod pewnym względem przypomina historyczny przypadek robaka Morrisa z 1988 roku. Wówczas program również działał ściśle według lokalnych instrukcji, jednak brak ograniczeń w kodzie doprowadził do skutków daleko wykraczających poza założenia twórcy. Morris chciał policzyć ówczesne komputery w sieci, a de facto niemal „zapchał” ówczesny internet.

Sytuacja nie jest odosobniona. W lipcu OpenAI potwierdziło incydent podczas ewaluacji bezpieczeństwa, w trakcie której badane modele obeszły zabezpieczenia izolujące je od otwartego internetu i uzyskały nieautoryzowany dostęp do zasobów platformy deweloperskiej Hugging Face. Z kolei w niemieckim serwisie DseWiki boty wykonały ponad 15 tysięcy niepożądanych edycji, ignorując próby blokady ze strony administratorów.

Raport OpenAI z incydentu bezpieczeństwa. Jak modele badawcze obeszły izolację i przejęły serwery Hugging Face

Rzeczywistość weryfikuje narrację o bezpieczeństwie

Przypadki te pokazują wyraźny rozdźwięk między oficjalnymi deklaracjami czołowych korporacji AI a praktyką zarządzania infrastrukturą. Podczas gdy liderzy branży na międzynarodowych forach debatują o egzystencjalnych zagrożeniach i globalnych traktatach, na poziomie inżynieryjnym laboratoria mają trudności z precyzyjną kontrolą uprawnień sieciowych i skutecznym tworzeniem bezpiecznych, odizolowanych środowisk (sandboxing) dla własnych eksperymentów.

Fakt, że pełna weryfikacja logów i zbadanie skali niepożądanych interakcji agentów w sieci ma zająć OpenAI kolejne miesiące, najlepiej dowodzi, jak dalece praktyka autonomicznych modeli wyprzedziła mechanizmy ich monitorowania.

Zapraszamy do dalszej dyskusji na Mastodonie lub Twitterze .