Choć modele bazowe stały się lepsze, prawdziwym przełomem umożliwiającym pewne wdrażanie ich produkcyjnie są rygorystyczne praktyki ewaluacyjne
Dobrze zaprojektowane ewaluacje pomagają menedżerom produktu, liderom nadzoru nad AI i dyrektorom technicznym bezpiecznie wdrażać agentów AI na dużą skalę, zmieniając AI z odizolowanej zabawki w przewagę konkurencyjną.
Pewność tę daje ocena zachowania agentów AI na podstawie rzeczywistych zapytań użytkowników, przypadków brzegowych i scenariuszy branżowych odzwierciedlających faktyczny kontekst biznesowy, a nie publiczny benchmark stwierdzający: „ten model jest najlepszy”
Celem jest uzasadnienie tej pewności za pomocą mierzalnych wyników. Sukces wymaga zdefiniowania pojęcia "dobry" w konkretny i mierzalny sposób, zgodny z potrzebami biznesowymi i tolerancją ryzyka — niezależnie od tego, czy chodzi o poprawność merytoryczną, właściwy ton, szybkość czy efektywność kosztową.
Uwzględniając ewaluację w całym systemie (instrumentacja, rejestrowanie, testy A/B i zabezpieczenia) oraz równoważąc rygor z wydajnością, zespoły mogą wdrażać szybciej i tworzyć bardziej niezawodne rozwiązania.
Większość firm akceptuje, że ich pracownicy eksperymentują z ChatGPT lub Gemini. Znacznie rzadziej wykorzystuje się jednak LLM w procesach i środowiskach o wysokiej stawce.
Często wynikało to z uzasadnionych obaw: jakość była nierówna, a ryzyko halucynacji lub niepożądanego zachowania przewyższało potencjalne korzyści z tej technologii.
W ostatnim roku bilans ryzyka i korzyści wyraźnie się zmienił. Częściowo wynika to z poprawy wydajności modeli bazowych, ale dużą rolę odegrało też coraz bardziej systematyczne podejście do ewaluacji (ang. „evals”). Ewaluacje dają nam i naszym klientom pewność potrzebną do wdrażania w ciągu kilku tygodni agentów działających na dużą skalę i obsługujących klientów.
W tym przewodniku omawiamy podstawy ewaluacji oraz sposoby jej projektowania, wdrażania i prowadzenia w produkcyjnych przypadkach użycia.
Celem ewaluacji nie jest znalezienie idealnego modelu, lecz uzyskanie uzasadnionej pewności, że model zachowuje się zgodnie z potrzebami firmy, oczekiwaniami użytkowników i tolerancją ryzyka organizacji.
U podstaw każdej strategii ewaluacji leży proste pytanie: Co oznacza „dobry”? Odpowiedź powinna być konkretna. Dla jednej organizacji „dobry” może oznaczać ścisłą poprawność merytoryczną, a dla innej priorytetem mogą być szybkość, efektywność kosztowa lub charakterystyczny ton komunikacji. Na tę definicję wpływają wszystkie ograniczenia — od zakresu danych, z których wolno korzystać, po obowiązujące wymogi regulacyjne.
Co najważniejsze, pojęcie 'dobry' musi obejmować elementy, które można rzeczywiście zmierzyć. Jeśli sukces oznacza udzielanie przydatnych porad finansowych, przydatność trzeba opisać za pomocą konkretnych cech: poprawności merytorycznej, odpowiednich zastrzeżeń, spersonalizowanego rozumowania i bezpiecznych granic. Po zdefiniowaniu pojęcia „dobry” w mierzalny sposób należy ustalić, jak analizować i interpretować wyniki. Dopiero wykorzystanie tych wyników sprawia, że ewaluacja staje się metodycznym procesem, a nie zbiorem subiektywnych ocen.
Każdy proces ewaluacji opiera się na trzech powiązanych filarach:
Dane wejściowe/benchmarki: reprezentatywne przykłady z rzeczywistego świata do badania ogólnej wydajności oraz starannie dobrane wewnętrzne zbiory danych do oceny przydatności w danej dziedzinie.
Zachowanie modelu: sposób wywoływania modelu (generowanie wspomagane wyszukiwaniem, streszczanie, wyszukiwanie ustrukturyzowanych informacji, użycie narzędzi).
Wskaźniki: sposób mierzenia i interpretowania wydajności.
Dane wejściowe muszą odzwierciedlać rzeczywistość, z którą zetknie się system. Najcenniejszych wniosków dostarczają rzeczywiste przykłady: zapytania klientów, scenariusze finansowe lub przypadki charakterystyczne dla danej branży. Tylko testując na takich przykładach, można sprawdzić, czy model naprawdę rozumie niuanse istotne dla użytkowników i zaspokaja potrzeby biznesowe.
Zachowanie modelu — sposób formułowania poleceń, koordynowania wyszukiwania lub użycia narzędzi i przekazywania kontekstu — jest równie ważne jak sam model. Dwa identyczne modele mogą zachowywać się zupełnie inaczej w zależności od sposobu wdrożenia. Dlatego tę warstwę należy uwzględnić w projekcie ewaluacji.
Ostatnim elementem są wskaźniki. Same liczby rzadko pokazują pełny obraz, lecz dobrze dobrane wskaźniki pozwalają zrozumieć zachowanie systemu. Opóźnienie, dokładność, bezpieczeństwo, spójność, stronniczość, koszt i zadowolenie użytkowników tworzą łącznie wielowymiarowy obraz systemu produkcyjnego. Sztuka polega na wyborze wskaźników zgodnych z KPI projektu lub firmy, które ukazują cechy najważniejsze dla użytkowników. Prostsze wskaźniki są często dokładniejsze i tańsze, natomiast źle dobrane mogą wprowadzać zespoły w błąd. Oto jak podejść do wyboru wskaźników:
Przykłady dobrze dobranych wskaźników:
Chatbot obsługi klienta: odsetek rozwiązania sprawy przy pierwszym kontakcie (czy problem użytkownika rozwiązano bez eskalacji?), średni czas obsługi, ocena zadowolenia użytkownika, odsetek eskalacji do konsultantów
Narzędzie do badań finansowych: poprawność cytowań (% twierdzeń z właściwym źródłem), zgodność faktów ze zweryfikowanymi danymi, trafność wyszukiwania (czy znaleziono właściwe dokumenty?), spójność rozumowania oceniana przez ekspertów branżowych
Asystent generowania kodu: poprawność składni, odsetek zaliczonych testów, liczba luk w zabezpieczeniach, czas do uzyskania działającego rozwiązania
Przykłady źle dobranych wskaźników:
Traktowanie wyłącznie długości odpowiedzi jako miary jakości (dłuższa ≠ lepsza)
Pomiar szybkości bez uwzględnienia kompromisu w zakresie dokładności
Śledzenie ocen pewności modelu bez sprawdzania ich względem faktycznej poprawności
Poleganie wyłącznie na wewnętrznej perplexity modelu bez weryfikacji z udziałem użytkowników
Typowe pułapki dotyczące wskaźników:
Sprzeczne wskaźniki: jednoczesna optymalizacja szybkości i kompletności bez uwzględnienia kompromisu między nimi
Nadmierne dopasowanie do benchmarków: osiągnięcie 95% w zbiorze testowym, ale niepowodzenie na produkcji, ponieważ rzeczywiści użytkownicy zachowują się inaczej
Dla jednego z klientów z silnie regulowanego sektora usług finansowych najważniejsza była dokładność rozwiązania do głębokich badań. Opracowaliśmy zbiory pytań i odpowiedzi przygotowane przez ekspertów oraz zbiory generowane przez narzędzia. Pozwoliło nam to ocenić precyzję, dobór właściwych narzędzi i wyszukiwanie odpowiednich informacji, dając zrównoważony obraz dokładności i jakości rozumowania. Kluczowy był pomiar wielu wymiarów: poprawności merytorycznej (weryfikacja ekspercka), jakości wyszukiwania (precyzja i pełność odpowiednich dokumentów) oraz spójności rozumowania (ustrukturyzowana ocena toku logicznego).
Kiedy używać LLM w roli sędziego do oceny złożonych aspektów jakości
Metoda LLM-as-a-judge wykorzystuje drugi model AI jako oceniający, zastępując pracę człowieka skalowalną, automatyczną oceną jakości. Metoda LLM-as-a-judge jest często nadużywana tam, gdzie prostsze wskaźniki zapewniłyby potrzebną dokładność. Może być przydatna, gdy testy deterministyczne nie potrafią uchwycić jakości, na przykład gdy wskaźnik ma charakter semantyczny (przydatność, oparcie na źródłach, jakość rozumowania, ton, interpretacja zasad) i ocena deterministyczna nie jest możliwa. Może być potrzebna skalowalna informacja zwrotna dla wielu wariantów poleceń i modeli, a także jasne kryteria i schemat ustrukturyzowanych danych wyjściowych. Aby skutecznie zastosować tę metodę, wykonaj następujące kroki:
Jasno określ wymiary kryteriów oceny: poprawność, oparcie na źródłach, zgodność z zasadami, praktyczność i ton.
W odpowiedziach oceniającego stosuj ustrukturyzowane dane wyjściowe (schemat JSON).
Rejestruj zarówno binarne wyniki progowe, jak i tekst diagnostyczny do analizy niepowodzeń.
W każdym cyklu wydawniczym kalibruj wyniki oceniającego względem próbek oznaczonych przez ludzi.
W obszarach o wysokiej stawce stosuj dwóch oceniających lub okresowe kontrole zgodności ocen.
Monitoruj w czasie dryf ocen oraz odsetek rozbieżności między oceniającymi.
Zbiór benchmarkowy to stały, starannie dobrany zestaw przykładów testowych ze znanymi odpowiedziami, który służy do spójnej oceny modeli i rzetelnego porównywania wyników między wersjami. Zwykle obejmuje dane wejściowe (np. zapytania użytkowników), oczekiwane wyniki lub oceny referencyjne oraz kryteria albo etykiety służące do punktacji. Publiczne testy benchmarkowe służą do porównywania wydajności najnowocześniejszych modeli i mogą stanowić wstępną wskazówkę przy wyborze modelu do projektowanego systemu.
Nie można jednak traktować tych benchmarków jako miary wydajności własnego systemu w konkretnym kontekście biznesowym, ponieważ mają one znane ograniczenia:
Zanieczyszczenie: modele mogły być trenowane na danych benchmarkowych, więc ocena na tym samym zbiorze przypomina sprawdzian z gotową ściągą.
Nasycenie: wszystkie czołowe modele osiągają już maksymalne wyniki, więc poprawa lub pogorszenie ogranicza się do kilku punktów procentowych i często mieści się w naturalnej zmienności wyników testów.
Wąski zakres: dane benchmarkowe nie odzwierciedlają rzeczywistych zadań, ponieważ są starannie dobierane i oczyszczane. Niektóre są nawet generowane przez LLM, więc nie oddają złożoności ani przypadków brzegowych występujących w rzeczywistych danych (literówki, nietypowe sformułowania, zaszumione obrazy).
Uczeń prosi aplikację o pomoc w rozwiązywaniu zadań tekstowych.
Przykład publicznego benchmarku: GSM8K (rozumowanie matematyczne na poziomie szkoły podstawowej)
Opcjonalny trudniejszy zestaw: MATH.
Dlaczego ten benchmark jest przydatny:
Pozwala szybko porównać, który model lepiej radzi sobie z ogólnym rozumowaniem matematycznym,
Stanowi dobry pierwszy filtr przed zainwestowaniem w pełną ewaluację produktu.
Dlaczego nadal potrzebujesz własnego zbioru danych:
Twoja aplikacja ma wymagania, których GSM8K nie sprawdza:
Terminologia i kolejność tematów w Twoim programie nauczania,
Styl wyjaśnień dostosowany do danej grupy wiekowej,
Sposób obsługi niejednoznacznych pytań uczniów lub pytań z licznymi literówkami,
Zasady działania (np. kiedy podawać wskazówki, a kiedy pełne odpowiedzi).
Skuteczna weryfikacja zależy od utworzenia benchmarków ewaluacyjnych właściwych dla aplikacji. Zbiory te powinny obejmować rzeczywiste interakcje, typowe przypadki brzegowe i prawdopodobne scenariusze awarii. Przy wdrażaniu nowego produktu lub procesu może to być trudne zadanie. W większości przypadków można jednak zebrać dane z istniejącego produktu lub rozpocząć ich gromadzenie jak najwcześniej, nawet podczas pierwszych testów. Po opracowaniu aplikacji benchmarki powinny ewoluować wraz z produktem, stając się z czasem bogatsze i bardziej reprezentatywne.
Studium przypadku: tworzenie niestandardowego benchmarku dla asystenta bankowości detalicznej
Chatbot bankowy odpowiada na pytania dotyczące budżetów, wydatków i transakcji. Publiczne benchmarki pytań i odpowiedzi oraz konwersji tekstu na SQL nie uwzględniały kluczowych zagrożeń bankowych, takich jak SQL injection, wycieki danych czy przenoszenie kontekstu między kolejnymi turami rozmowy. Stworzyliśmy niestandardowy benchmark odzwierciedlający proces agentowy tego produktu.
Elementy niestandardowego benchmarku w tej bazie kodu:
Zestaw red-team złośliwych poleceń testujących SQL injection, wydobywanie danych osobowych, nadpisywanie poleceń i wycieki między sesjami
Zerowa tolerancja w zakresie bezpieczeństwa: każda próba SQL injection, wydobycia danych osobowych lub wycieku między sesjami musi zostać odrzucona.
Dokładność przenoszenia kontekstu: przeformułowane zapytania muszą zachowywać intencję użytkownika i wskazane encje.
Najważniejszy wniosek: tworzenie benchmarku należy traktować jako funkcję produktu. Obecne otoczenie operacyjne potwierdza, że ewaluacja kompleksowa jest prawidłowo zintegrowana, ale zakres i liczebność próbek muszą wzrosnąć, aby odzwierciedlać rzeczywiste zagrożenia bankowe (ataki o wielu intencjach, obchodzenie zabezpieczeń i zapytania zależne od kontekstu). Benchmark powinien być rozszerzany wraz z nowymi agentami i zabezpieczeniami.
Powiązanie benchmarku właściwego dla aplikacji z wyborem modelu ma kluczowe znaczenie. Benchmark pokazuje nie tylko, czy rozwiązanie działa, lecz także jaka kombinacja rozmiaru modelu i technik potreningowych zapewnia wymaganą wydajność najniższym kosztem. Największe ulepszenia wstępnie wytrenowanych modeli (stąd „PT” w nazwie ChatGPT) wynikają nie z ponownego trenowania, lecz z metod "potreningowych".
Metody te kształtują zakres informacji dostępnych dla modelu, ich strukturę oraz sposób kierowania modelem i koordynowania go podczas wnioskowania. Techniki potreningowe, takie jak:
Polecenia wykorzystujące łańcuch rozumowania i dynamiczny przydział mocy obliczeniowej (więcej rozumowania przy trudniejszych problemach)
Samouzgadnianie, w którym generuje się wiele wyników, a następnie wybiera najlepszy
Budowanie i koordynowanie kontekstu, np. generowanie wspomagane wyszukiwaniem (RAG), polecenia z kilkoma przykładami i procesy wykorzystujące agentów
Użycie narzędzi i dostęp do zewnętrznej wiedzy, dzięki którym model może działać poza zakresem swoich wewnętrznych parametrów
Strategie reprezentowania i przechowywania wiedzy, projektowane z myślą o wydajnym wyszukiwaniu i rozumowaniu na danych ustrukturyzowanych i nieustrukturyzowanych
Choć techniki potreningowe mogą znacznie poprawić wydajność systemu, wiążą się również z kompromisami. Każda kolejna warstwa koordynacji, wyszukiwania lub rozumowania zwiększa złożoność systemu, czas wnioskowania i koszty operacyjne. Odpowiednio dobrane techniki potreningowe często pozwalają jednak korzystać z mniejszych, szybszych i tańszych modeli bez rezygnacji z wymaganej wydajności. Zamiast zwiększać rozmiar modelu, wydajność osiąga się dzięki lepszemu projektowi systemu.
Właściwa równowaga zależy od konkretnej aplikacji, dlatego optymalny zestaw technik należy ustalać za pomocą ewaluacji właściwych dla tej aplikacji. Pozwalają one wskazać moment, w którym dalsza koordynacja przestaje przynosić istotne korzyści, dzięki czemu zespół może wybrać minimalny poziom złożoności potreningowej potrzebny do osiągnięcia docelowej wydajności.
Rozwiązanie AI należy traktować jako cały system: bazy danych, interfejsy API, interfejsy użytkownika, warstwy koordynacji, infrastrukturę monitorującą i inne elementy. Ewaluacja musi zatem obejmować cały stos technologiczny. Należy monitorować kluczowe elementy systemu, aby zachować wgląd w potencjalne problemy i odpowiedzialnie przyspieszać rozwój.
Monitorowanie kluczowych elementów systemu oznacza:
Instrumentowanie procesów w celu uzyskania mierzalnych wyników.
Rejestrowanie eksperymentów, aby śledzić wpływ każdej zmiany.
Stosowanie prostych porównań A/B przed wdrożeniem istotnych zmian w celu wykrycia potencjalnych regresji.
Iteracyjne doskonalenie oparte na danych skraca drogę od prototypu do produkcji i eliminuje martwe pola. Rejestrowanie i monitorowanie są również ważne dla zrozumienia rzeczywistego sposobu używania aplikacji. Oto przykład zapewnienia obserwowalności:
Krok 1: żądanie użytkownika trafia do systemu z request_id, user_segment i intent.
Krok 2: ślad rejestruje wersję modelu, wersję polecenia, pobrane dokumenty i wywołania narzędzi.
Krok 3: LLM ocenia odpowiedź (correctness, groundedness, policy_risk).
Krok 4: silnik reguł sprawdza wartości progowe.
Krok 5: w razie przekroczenia progu uruchamiany jest alert, a sprawa trafia do rozwiązania awaryjnego lub weryfikacji przez człowieka.
Krok 6: niepowodzenie trafia do kolejki selekcji, a następnie do rejestru zadań benchmarku.

Rzeczywiści użytkownicy rzadko zachowują się dokładnie tak, jak oczekują projektanci. Niektórzy źle zrozumieją instrukcje. Inni będą celowo szukać słabych punktów. Takie przypadki brzegowe nie są anomaliami, lecz bezcennymi sygnałami. Dobrze wdrożony proces ewaluacji wychwytuje je, analizuje i uwzględnia w przyszłych testach. Szybkie doskonalenie bez martwych pól jest możliwe tylko wtedy, gdy ewaluacja stanowi integralną część systemu, a nie dodatek po zakończeniu prac.
Zalecamy wdrożenie zabezpieczeń i monitorowania od pierwszego dnia:
Regularnie monitoruj wskaźniki modelu i regresje za pomocą benchmarku właściwego dla aplikacji.
Rejestruj i analizuj przypadki brzegowe oraz wrogie dane wejściowe (i dodawaj je do zbioru benchmarkowego właściwego dla aplikacji).
Upewnij się, że wskaźniki ewaluacji są zgodne z kluczowymi KPI.
Regularnie kwestionuj założenia zbioru danych i benchmarku, aby nie przeoczyć nowych zagrożeń ani nie ulec stronniczości.
Wdróż automatyczne alerty informujące o pogorszeniu wskaźników (np. jeśli dokładność spadnie poniżej 85%, uruchom weryfikację).
W przypadku decyzji o wysokiej stawce utrzymuj proces weryfikacji przez człowieka (porady prawne i medyczne, transakcje finansowe).
Każde uruchomienie benchmarku zużywa moc obliczeniową i energię. Każdy zbędny eksperyment zwiększa koszty. Odpowiedzialna ewaluacja powinna równoważyć rygor i wydajność.
Aby nie dopuścić do gwałtownego wzrostu zużycia energii i kosztów, można podjąć następujące działania:
Gdy to możliwe, używaj mniejszych modeli: pierwsze eksperymenty prowadź na tańszych modelach, a skalę zwiększaj dopiero po zweryfikowaniu podejścia.
Buforuj polecenia i wywołania API.
Planuj zadania z uwzględnieniem energii (przetwarzanie wsadowe, instancje spot, elastyczny priorytet).
Monitoruj zużycie mocy obliczeniowej wraz z wydajnością.
Równie ważne jest śledzenie nowych regulacji dotyczących AI. Nawet jeśli nie istnieją odrębne przepisy, nadal obowiązują istniejące ramy prawne i niezbędne działania, takie jak:
Ochrona danych:
Upewnij się, że zbiory benchmarkowe nie zawierają danych osobowych bez właściwej zgody
Wdróż zasady przechowywania rejestrowanych zapytań
Zapewnij mechanizmy obsługi żądań usunięcia danych
Równość i stronniczość:
Testuj wydajność w różnych grupach demograficznych
Zadbaj o różnorodną reprezentację podczas tworzenia benchmarku
Prawa człowieka i przejrzystość:
Jasno informuj użytkowników o ograniczeniach modelu
Wyjaśniaj decyzje o wysokiej stawce
Zapewnij nadzór człowieka nad krytycznymi zastosowaniami
Ewaluacja nie jest jednorazowym wydarzeniem, lecz stale rozwijającym się systemem. W szybko zmieniającej się dziedzinie przewagę daje tempo testowania, uczenia się i adaptacji, które pozwala skuteczniej wdrażać modele i nowe rozwiązania.
Traktując ewaluację jako kluczowy element prac inżynieryjnych i zarządzania produktem, zespoły mogą wprowadzać innowacje szybciej i bezpieczniej. Najpierw określ, co oznacza dobry wynik w kontekście Twojej aplikacji AI, utwórz platformę ewaluacyjną, a następnie ją rozwijaj, aby zyskać benchmark właściwy dla aplikacji, który przy każdej iteracji potwierdzi gotowość do wdrożenia produkcyjnego.