Nowości

AWS udostępnia Agent-EvalKit, otwarte narzędzie do testowania agentów AI

Agenty AIPatryk Raba
AWS udostępnia Agent-EvalKit, otwarte narzędzie do testowania agentów AI
Fot. Nemuel Sereti, Pexels (Pexels License)
Spis treści
  1. Jak działa narzędzie
  2. Trzy wymiary oceny
  3. Kontekst rynkowy
  4. Znaczenie dla polskich zespołów

Amazon Web Services udostępniło Agent-EvalKit, otwarty toolkit do systematycznego testowania agentów AI, który zamiast oceniać tylko finalną odpowiedź modelu, śledzi całą ścieżkę jego działania: wywołania narzędzi, stany pośrednie i przepływ danych między krokami.

Projekt trafia w rosnący problem firm wdrażających agentów AI: standardowe testy jednostkowe i porównania odpowiedzi końcowej nie wychwytują błędów, które pojawiają się po drodze, gdy agent samodzielnie wybiera narzędzia i łączy wyniki z kilku źródeł. Klasyczne testowanie sprawdza, czy odpowiedź jest poprawna, ale nie mówi, dlaczego agent się pomylił ani w którym kroku.

Jak działa narzędzie

Agent-EvalKit prowadzi użytkownika przez sześć faz, z których każda uruchamiana jest jako komenda w asystencie kodującym: planowanie strategii ewaluacji, generowanie przypadków testowych, dodanie instrumentacji śledzącej zgodnej z OpenTelemetry, uruchomienie agenta i zebranie śladów wykonania, implementację metryk oraz wygenerowanie raportu z rekomendacjami przypisanymi do konkretnych fragmentów kodu.

Narzędzie integruje się bezpośrednio z asystentami kodującymi, w tym Claude Code, Kiro CLI i Kilo Code, więc cały proces ewaluacji odbywa się w tym samym środowisku, w którym powstaje kod agenta. Zamiast oddzielnego frameworku testowego programista dostaje zestaw poleceń slash, które prowadzą go krok po kroku od planu testów po gotowy raport.

Trzy wymiary oceny

Kluczowa różnica względem prostszych narzędzi polega na tym, że Agent-EvalKit ocenia jednocześnie trzy wymiary działania agenta: wiarygodność, czyli czy odpowiedź faktycznie opiera się na danych zwróconych przez narzędzia, dokładność parametrów przekazywanych do wywoływanych funkcji oraz ogólną jakość odpowiedzi. Rozdzielenie tych trzech metryk pozwala wskazać, na którym etapie łańcucha działań agent zaczyna generować treści niepowiązane z realnymi danymi.

Agenci, którzy samodzielnie wybierają narzędzia i sekwencjonują operacje na wielu źródłach, generują zachowania, których testowanie na poziomie samego wyniku nie jest w stanie w pełni scharakteryzować - dokumentacja Agent-EvalKit, AWS

W opublikowanym przez AWS studium przypadku agent badawczy zajmujący się planowaniem podróży osiągnął 83,9 procent w ocenie ogólnej jakości odpowiedzi i 64,5 procent dokładności parametrów narzędzi, ale zaledwie 32,3 procent wiarygodności. Rozbieżność ujawniła systematyczne halucynacje: gdy wyszukiwanie w sieci nie zwracało wyników, agent i tak generował konkretne, brzmiące wiarygodnie odpowiedzi zamiast zgłosić brak danych.

Kontekst rynkowy

Publikacja Agent-EvalKit wpisuje się w szerszy trend, w którym dostawcy chmury i frameworków agentowych inwestują w narzędzia do testowania i obserwowalności agentów, bo klienci coraz częściej zgłaszają, że agenci produkcyjni zawodzą w sposób trudny do zdiagnozowania standardowymi metodami. AWS rozwija równolegle Strands Agents SDK, framework open source do budowy agentów, dla którego Agent-EvalKit jest naturalnym rozszerzeniem stosu narzędziowego.

Repozytorium na GitHubie działa na licencji Apache 2.0, co pozwala na dowolne komercyjne wykorzystanie i modyfikację kodu. Projekt wymaga Pythona 3.11 lub nowszego oraz menedżera pakietów uv, a instalacja sprowadza się do jednej komendy pobierającej najnowszą wersję z gałęzi głównej repozytorium.

Znaczenie dla polskich zespołów

Dla polskich firm wdrażających agentów AI w produktach czy wewnętrznych procesach narzędzie tego typu adresuje problem, który coraz częściej pojawia się w rozmowach z klientami korporacyjnymi: agent wygląda na działający poprawnie w demo, ale w produkcji podejmuje decyzje na podstawie niepełnych lub pustych danych z narzędzi, czego nie widać bez śledzenia pełnej ścieżki wykonania. Otwarty, darmowy toolkit integrujący się z popularnymi asystentami kodującymi obniża próg wejścia dla zespołów, które nie mają budżetu na komercyjne platformy obserwowalności agentów.

Agent-EvalKit nie zastępuje ludzkiej weryfikacji, ale automatyzuje najbardziej pracochłonną część procesu: generowanie przypadków testowych i wskazywanie, które fragmenty kodu odpowiadają za konkretne błędy. Dla zespołów pracujących z frameworkami LangGraph czy CrewAI, które AWS wymienia jako obsługiwane, oznacza to możliwość podłączenia narzędzia do istniejącego kodu bez przepisywania agenta pod nowy framework testowy.

Udostępnij: