AI red teaming · LLM · RAG · agenci

Testy penetracyjne AI i LLM od prompt injection do wpływu na systemy.

Sprawdzamy cały produkt AI: model, prompt, RAG, dane, narzędzia, API, role, integracje i sposób wykorzystania odpowiedzi przez kolejne systemy.

1000+zrealizowanych pentestów
20+ latdoświadczenia większości zespołu
1 retestzazwyczaj w cenie
globalnieprojekty po polsku i angielsku

System prompt nie jest firewallem

Ryzyko systemu AI nie kończy się na wygenerowaniu niepożądanej treści. Krytyczny wpływ pojawia się, gdy model może odczytać dane, wywołać narzędzie, wpłynąć na workflow albo przekazać niezaufany output do aplikacji, poczty czy API.

Test wykonujemy w trybie black-box, gray-box lub z przeglądem architektury. Wyniki mapujemy między innymi do OWASP Top 10 for LLM Applications.

Co obejmuje test

  • direct i indirect prompt injection, system prompt leakage i obchodzenie guardrails;
  • RAG, cross-user/cross-tenant retrieval, poisoning, dokumenty i kontrola źródeł;
  • tool/function calling, nadmiarowe uprawnienia agentów i niebezpieczne akcje;
  • wycieki danych, retencja, linki share, logi, indeksy i artefakty generowane przez AI;
  • autoryzacja API ukryta za interfejsem konwersacyjnym i IDOR/BOLA przez warstwę AI;
  • unsafe output handling, HTML, e-mail, JSON, automatyzacje i downstream impact.

Jak pracujemy

1. Zakres i ROE

Ustalamy cele, systemy, wyłączenia, konta testowe, okno prac i bezpieczne zasady komunikacji.

2. Test manualny

Automatyzacja wspiera rekonesans, lecz potwierdzenie podatności i łańcuchów ataku wykonuje pentester.

3. Raport

Zarząd otrzymuje wpływ biznesowy, a IT dowody, priorytety i konkretne zalecenia naprawcze.

4. Retest

Jedno podejście retestowe jest zazwyczaj w cenie, o ile oferta nie stanowi inaczej.

Przykładowy przebieg techniczny

model surface -> prompt boundary -> RAG/data isolation -> tool permissions -> API authorization -> output sinks -> controlled abuse chain -> guardrails -> regression suite

Co otrzymuje klient

  • raport techniczny z dowodami, oceną ryzyka i instrukcjami naprawy;
  • executive summary dla zarządu i właścicieli ryzyka;
  • prezentację wyników dla zespołu technicznego i kadry zarządzającej;
  • raport w języku polskim lub angielskim;
  • jedno podejście retestowe, o ile oferta nie stanowi inaczej;
  • możliwość podpisania NDA przed przekazaniem zakresu.

Najczęstsze pytania

Czy testujecie tylko chatboty?

Nie. Testujemy również systemy generujące dokumenty, klasyfikatory, workflow, agentów, RAG, funkcje API oraz LLM ukryte za formularzem.

Czy potrzebujecie dostępu do modelu?

Możemy rozpocząć od interfejsu użytkownika. Dostęp do architektury, promptów, konfiguracji RAG i listy narzędzi zwiększa pokrycie.

Czy oceniacie prywatność danych?

Tak. Sprawdzamy separację użytkowników i tenantów, retencję, logi, linki share, indeksowanie oraz możliwość ujawnienia danych przez odpowiedzi lub narzędzia.

Czy raport zawiera testy regresyjne?

Tak. Dla potwierdzonych klas błędów przygotowujemy scenariusze, które mogą zostać wykorzystane po naprawie i w dalszym rozwoju produktu.

Czy test obejmuje LLM01:2025 Prompt Injection?

Tak. Sprawdzamy bezpośredni, pośredni i wielomodalny prompt injection, jailbreaking, payload splitting oraz instrukcje ukryte w dokumentach, obrazach i treściach pobieranych z Internetu. Oceniamy nie tylko odpowiedź modelu, lecz także wpływ na dane, narzędzia i procesy biznesowe.

Czy test obejmuje LLM02:2025 Sensitive Information Disclosure?

Tak. Weryfikujemy możliwość ujawnienia danych innych użytkowników i tenantów, sekretów, historii rozmów, danych treningowych, logów, treści RAG oraz informacji przekazywanych do zewnętrznych modeli. Sprawdzamy również retencję, linki współdzielone i eksporty.

Czy test obejmuje LLM03:2025 Supply Chain?

Tak. Analizujemy pochodzenie modeli, adapterów, datasetów, bibliotek, kontenerów, promptów, rozszerzeń i zewnętrznych dostawców API. Szukamy niezweryfikowanych artefaktów, podatnych zależności, ryzyka przejęcia modelu oraz słabych kontroli integralności.

Czy test obejmuje LLM04:2025 Data and Model Poisoning?

Tak. Badamy zatruwanie danych treningowych, fine-tuningu, pamięci długoterminowej, dokumentów RAG i baz wektorowych. Sprawdzamy, czy atakujący może utrwalić instrukcję, zmanipulować klasyfikację albo wpłynąć na odpowiedzi innych użytkowników.

Czy test obejmuje LLM05:2025 Improper Output Handling?

Tak. Traktujemy odpowiedź modelu jako niezaufane dane i testujemy jej dalsze użycie w HTML, Markdown, SQL, powłoce systemowej, poczcie, plikach, JSON i automatyzacjach. Szukamy między innymi XSS, injection, SSRF, niebezpiecznych linków i wykonania poleceń przez downstream.

Czy test obejmuje LLM06:2025 Excessive Agency?

Tak. Weryfikujemy uprawnienia agentów, function calling, wtyczki, konektory i akcje wykonywane bez potwierdzenia człowieka. Sprawdzamy zasadę najmniejszych uprawnień, możliwość łączenia narzędzi oraz scenariusze prowadzące do wysłania wiadomości, zmiany danych lub wykonania transakcji.

Czy test obejmuje LLM07:2025 System Prompt Leakage?

Tak. Sprawdzamy ujawnienie promptu systemowego, instrukcji deweloperskich, polityk, nazw narzędzi i danych konfiguracyjnych. Sam wyciek promptu oceniamy w kontekście wpływu: czy ułatwia obejście kontroli, dostęp do sekretów albo wykorzystanie innych podatności.

Czy test obejmuje LLM08:2025 Vector and Embedding Weaknesses?

Tak. Testujemy izolację tenantów w bazie wektorowej, kontrolę dostępu do dokumentów, embedding inversion, błędy filtrowania metadanych, konflikt źródeł i poisoning RAG. Weryfikujemy, czy użytkownik może odzyskać treść, do której nie powinien mieć dostępu.

Czy test obejmuje LLM09:2025 Misinformation?

Tak. Oceniamy halucynacje, błędne cytowania, nieuzasadnioną pewność, podatność na manipulację źródłami i ryzyko podjęcia decyzji na podstawie niezweryfikowanej odpowiedzi. Sprawdzamy mechanizmy groundedness, provenance, abstention i human-in-the-loop.

Czy test obejmuje LLM10:2025 Unbounded Consumption?

Tak. Badamy brak limitów tokenów, zapętlone działania agentów, kosztowne prompty, masowe wywołania, denial of wallet, kolejki, timeouty i możliwość ekstrakcji modelu przez API. Raport zawiera limity techniczne i biznesowe, które ograniczają koszt oraz utratę dostępności.

Czy testujecie agentów AI i systemy wieloagentowe?

Tak. Testujemy delegowanie zadań, przekazywanie kontekstu, zaufanie między agentami, pamięć, planowanie, tool chaining i możliwość eskalacji uprawnień przez sekwencję pozornie dozwolonych akcji. Szczególną uwagę poświęcamy akcjom nieodwracalnym i granicom zatwierdzania.

Czy testujecie modele multimodalne, pliki i obrazy?

Tak. Sprawdzamy instrukcje ukryte w obrazach, PDF, dokumentach biurowych, metadanych, OCR i treściach pobieranych przez konektory. Test obejmuje również różnice między tym, co widzi użytkownik, a tym, co faktycznie trafia do modelu.

Czy test obejmuje model theft, adversarial examples i extraction attacks?

Tak, gdy te ryzyka występują w zakresie produktu. Oceniamy ekstrakcję zachowania modelu, nadużycie logprobs, inference attacks, adversarial inputs, omijanie klasyfikatorów oraz możliwość odtworzenia danych lub funkcji modelu przez kontrolowane zapytania.

Jak wygląda retest systemu AI, skoro odpowiedzi modelu są niedeterministyczne?

Budujemy zestaw powtarzalnych przypadków testowych z wariantami językowymi, rolami, kontekstem i oczekiwanym skutkiem bezpieczeństwa. Retest ocenia redukcję prawdopodobieństwa oraz, przede wszystkim, ograniczenie wpływu przez autoryzację, sandboxing, walidację i zatwierdzanie akcji.

Co to jest prompt injection w systemach AI i chatbotach?

Prompt injection polega na dostarczeniu instrukcji, która zmienia zamierzone zachowanie modelu lub systemu. Może prowadzić do ujawnienia danych, obejścia reguł, użycia narzędzia albo wykonania nieautoryzowanej operacji. Ryzyko oceniamy na poziomie całego produktu, nie tylko treści odpowiedzi.

Na czym polega prompt injection w kontekście pracy agentów AI?

Agent AI może czytać dokumenty, planować kroki i wywoływać narzędzia. Złośliwa instrukcja ukryta w wiadomości, stronie lub pliku może nakłonić go do zmiany planu, pobrania danych albo wykonania akcji. Dlatego testujemy granice uprawnień, zatwierdzanie przez człowieka i autoryzację każdej operacji.

Czym różni się direct prompt injection od indirect prompt injection?

Direct prompt injection pochodzi bezpośrednio od użytkownika rozmawiającego z modelem. Indirect prompt injection znajduje się w zewnętrznej treści przetwarzanej przez system, na przykład dokumencie RAG, e-mailu, stronie WWW lub obrazie. W obu przypadkach kluczowe jest ograniczenie wpływu na dane i narzędzia.

Co to jest RAG i dlaczego system RAG trzeba testować?

RAG, czyli Retrieval-Augmented Generation, uzupełnia odpowiedź modelu treściami pobranymi z dokumentów lub baz wiedzy. Błędy filtrowania, metadanych i autoryzacji mogą ujawnić dane innego użytkownika albo tenantu. Dokument może też zawierać pośredni prompt injection wpływający na model i agenta.

Jak testujecie bezpieczeństwo pipeline RAG i baz wektorowych?

Sprawdzamy ingest dokumentów, źródła, chunking, embeddingi, metadane, filtrowanie tenantów, uprawnienia, cytowania i pamięć. Testujemy poisoning, odzyskiwanie cudzych dokumentów, manipulację rankingiem oraz instrukcje ukryte w treści. Wynik obejmuje zarówno wyciek danych, jak i wpływ na działanie agenta.

Co to jest OWASP Top 10 for LLM Applications i czy test obejmuje całą listę?

To zestaw najważniejszych klas ryzyka dla aplikacji wykorzystujących modele językowe. Zakres BSTA obejmuje wszystkie pozycje OWASP LLM Top 10 2025, w tym prompt injection, wycieki, supply chain, poisoning, output handling, excessive agency, system prompt leakage, RAG, misinformation i unbounded consumption.

Czym pentest AI różni się dla chatbota, agenta, modelu i systemu RAG?

Chatbot koncentruje się na rozmowie i danych, agent dodatkowo wykonuje narzędzia, RAG pobiera wiedzę, a własny model wprowadza ryzyka treningu, ekstrakcji i supply chain. Zakres budujemy dla rzeczywistej architektury produktu i badamy granice zaufania między wszystkimi warstwami.

Ile kosztuje pentest AI i jak długo trwa?

Podstawowy zakres zaczyna się od 4 000 PLN netto. Realizacja testu zajmuje od 5 dni roboczych. Cena i termin zależą od liczby modeli, ról, źródeł RAG, narzędzi, integracji i procesów biznesowych, a ostateczne warunki potwierdza oferta.

Jak sprawdzacie bezpieczeństwo danych przetwarzanych przez AI?

Testujemy separację użytkowników i tenantów, retencję, logi, pamięć rozmów, cache, linki współdzielone, eksporty, bazy wektorowe i przepływ danych do dostawców modeli. Sprawdzamy również, czy prompt lub narzędzie może ujawnić dane, których użytkownik nie może odczytać przez zwykłe API.

Czy testujecie integracje z OpenAI, Claude, Gemini, Grok i modelami lokalnymi?

Tak. Testujemy aplikację i jej integrację niezależnie od dostawcy modelu: klucze, role, retencję, routing, fallback, RAG, narzędzia, logi i obsługę odpowiedzi. Uwzględniamy funkcje konkretnej platformy, ale odpowiedzialność za autoryzację i bezpieczne użycie danych pozostaje po stronie produktu.

Czym bezpieczeństwo AI różni się od model safety i testów jakości odpowiedzi?

Model safety koncentruje się często na szkodliwych lub niedozwolonych treściach, a test jakości na poprawności odpowiedzi. Pentest bezpieczeństwa sprawdza, czy system może ujawnić dane, wykonać nieautoryzowaną akcję, zostać zatruty albo narazić organizację na koszty i utratę dostępności. Te obszary uzupełniają się, ale nie są zamienne.

Jak wybrać firmę do pentestu AI, LLM lub systemu RAG?

Wykonawca powinien łączyć znajomość AI z klasycznym bezpieczeństwem aplikacji, API, chmury i autoryzacji. Warto wymagać testów rzeczywistego wpływu, agentów, RAG i narzędzi, przykładowego raportu oraz metody niedeterministycznego retestu. Samo generowanie obraźliwych odpowiedzi nie jest pełnym pentestem AI.

Co powinien zawierać profesjonalny raport z pentestu AI?

Raport powinien opisywać model, role, źródła danych, RAG, narzędzia i granice zaufania, a dla każdego problemu wskazywać wpływ, CVSS, OWASP LLM, PoC i naprawę. Potrzebne są także warianty testowe, kryteria zamknięcia, kontrola niedeterministyczności i retest potwierdzający ograniczenie wpływu.

Powiązane obszary testów i ochrony