Amerykańska firma Anthropic ujawniła kolejny przypadek, w którym jej model sztucznej inteligencji (AI) naruszył zewnętrzne systemy podczas testowania. Incydent miał miejsce w styczniu i dotyczył wczesnej wersji modelu Claude Opus 4.6. Firma odkryła go jednak dopiero w sierpniu, pomimo wcześniejszego przeprowadzenia szeroko zakrojonego przeglądu – podał Reuters.
Może Cię zainteresować: Trading vs. Inwestowanie
Wady rozumowania Claude’a skłaniają do kontroli bezpieczeństwa
Anthropic poinformował, że powiadomił wszystkie dotknięte strony, choć nie ujawnił dalszych szczegółów. Podczas wstępnego przeglądu 141 006 sesji testowych firma pominęła część danych. Ich późniejsze odkrycie doprowadziło do zidentyfikowania czwartego incydentu bezpieczeństwa. Według wstępnej oceny nowy przypadek nie był poważniejszy niż trzy poprzednie, które firma szczegółowo zbadała.
Według Anthropic jednym z problemów były wady rozumowania, w których model Claude pomijał lub błędnie identyfikował dowody na to, że działa w otwartym internecie. Jako drugi powtarzający się problem Anthropic zidentyfikował skłonność modeli do podejmowania potencjalnie szkodliwych działań w celu wykonania zadania. Firma zleciła zewnętrznej firmie badawczej METR zbadanie incydentu.
Czytaj więcej: eToro – Recenzja
Błąd otwartego internetu wywołał naruszenia korporacyjne
W lipcu firma ogłosiła, że niektóre z jej modeli naruszyły systemy trzech firm podczas testów cyberbezpieczeństwa. Główną przyczyną incydentów hakerskich był błąd, który nieumyślnie przyznał modelom dostęp do otwartego internetu.
Te incydenty przyczyniły się do rosnących obaw dotyczących zagrożeń stwarzanych przez autonomicznych agentów AI, którzy mogą omijać zasady i wykorzystywać nieoczekiwane sposoby interakcji z zewnętrznymi systemami.
Nie przegap: Recenzja BITmarkets.com – Bezpieczny handel
Źródło: Reuters









