Sprawdzaj, ile kosztuje poprawnie zakończona sprawa — razem z kontrolą, poprawkami i obsługą wyjątków.
Agenci AI mają skrócić drogę od zapytania klienta do gotowej oferty. Wyobraź sobie jednak polską hurtownię, w której propozycja powstaje błyskawicznie, a handlowiec później sprawdza każdą cenę, termin dostawy i uzgodniony rabat. Program wykonał zadanie, ale człowiek nadal musi poskładać wynik w całość. W takim wdrożeniu warto mierzyć czas do uzyskania oferty, którą rzeczywiście można wysłać klientowi.
Dla właściciela firmy to przydatny punkt wyjścia do oceny sztucznej inteligencji. O opłacalności decyduje koszt doprowadzenia sprawy do końca: wraz z poprawkami, nadzorem i obsługą wyjątków. Dlatego przed zakupem kolejnego narzędzia warto sprawdzić, jak agent otrzymuje informacje, z jakich systemów korzysta i kto zatwierdza jego działania.
Co pozwala agentowi wykonać zadanie
Model językowy odpowiada za interpretowanie poleceń i tworzenie odpowiedzi. Agent łączy te możliwości z wykonywaniem kolejnych czynności, na przykład wyszukiwaniem danych oraz przygotowaniem dokumentu. Potrzebuje przy tym oprogramowania, które udostępnia narzędzia, przekazuje wyniki poprzednich kroków i zarządza przebiegiem pracy.
W międzynarodowej dyskusji badaczy i przedsiębiorców Y Combinator podkreśla właśnie znaczenie otoczenia modelu dla skuteczności agenta. Używany tam termin harness oznacza warstwę oprogramowania sterującą jego pracą. Dla przedsiębiorcy wynika z tego praktyczny wniosek: oceniaj cały sposób realizacji zadania, łącznie z dostępem do informacji i kontrolą wyniku.
W przykładowej hurtowni taka warstwa mogłaby pobierać aktualny cennik, sprawdzać dostępność towaru i kierować ofertę do zatwierdzenia. Warto przy tym ustalić, które informacje są wiążące, gdy wiadomość od klienta przeczy zapisowi w systemie. Droższy model nie rozstrzygnie za właściciela, kto w firmie ma prawo zmieniać warunki sprzedaży.
Dobrym początkiem jest więc wybór konkretnego problemu do automatyzacji. Przygotowanie oferty na podstawie zatwierdzonego cennika daje wyraźniejszy zakres próby niż ogólna obietnica usprawnienia sprzedaży. Łatwiej też wskazać moment, w którym praca została poprawnie zakończona.
Policz pełny koszt obsłużonego zapytania
Agenci AI powinni być oceniani na zadaniach, które firma rzeczywiście wykonuje. Wybierz próbkę zakończonych spraw: rutynowych, niekompletnych oraz wymagających odstępstwa od standardowych zasad. Zachowaj ten sam zestaw przy porównywaniu kolejnych wersji narzędzia, żeby zmiana trudności przykładów nie udawała poprawy jakości.
W naszej hipotetycznej hurtowni kryteria odbioru mogłyby obejmować zgodność cen, dostępności i warunków handlowych z zatwierdzonymi danymi. Brak informacji powinien skutkować pytaniem do odpowiedniej osoby. Oferty z wymyślonym terminem dostawy nie można zaliczyć do poprawnych tylko dlatego, że dobrze się ją czyta.
Do rachunku włącz opłaty za działanie systemu, czas sprawdzania, poprawki i obsługę nieudanych prób. Koszt całej próby podziel przez liczbę spraw zakończonych zgodnie z przyjętymi kryteriami. Osobno pokaż wdrożenie i późniejsze utrzymanie, ponieważ koszty AI w firmie obejmują także pracę nad wdrożeniem.
Taki pomiar pozwala zauważyć pozorne oszczędności. Tańsze odpowiedzi mogą wymagać dłuższej kontroli, a droższe przetwarzanie może ograniczyć liczbę poprawek. Wynik trzeba porównać z dotychczasowym sposobem pracy przy tej samej definicji poprawnie obsłużonej sprawy.
Firmowa wiedza ma swoich odbiorców
Przydatność agenta zależy również od tego, komu wolno przekazać wynik. Josh France i Regan Bell, prezentując firmowy system QM, wskazują na trudności agentów z rozumieniem kontekstu społecznego i uprawnień, od 58:50. Zwracają uwagę, że człowiek potrafi wyczuć, gdzie może podzielić się informacją, a odtworzenie tego w oprogramowaniu wymaga pracy.
Przełóżmy tę obserwację na ofertowanie. Wewnętrzna informacja o minimalnej marży może pomagać przy ocenie rabatu, ale nie powinna trafiać do wiadomości dla klienta. Podobnie indywidualne warunki jednego odbiorcy nie powinny pojawiać się w propozycji dla innego.
W projekcie wdrożenia warto więc oddzielić prawo odczytu danych od prawa ich ujawniania i zmieniania. Przygotowanie szkicu, wysłanie oferty oraz aktualizacja cennika to osobne uprawnienia. Każde z nich powinno mieć określonego właściciela, a wykonane operacje powinny zostawiać ślad umożliwiający sprawdzenie, co się wydarzyło.
To ma bezpośredni związek z kosztami. Czas wyjaśniania błędnie wysłanej oferty również obciąża firmę, choć nie pojawia się na fakturze za model. W próbie trzeba zatem sprawdzać także przypadki, w których agent powinien zatrzymać działanie i przekazać sprawę człowiekowi.
Dłuższa praca potrzebuje uzasadnienia
Twórcy QM opisują też eksperyment z budżetem przypisanym do celu, w części rozpoczynającej się od 57:16. Ich problemem było zbyt wczesne porzucanie zadań. Mechanizm miał skłaniać agenta do dalszej pracy przez określony czas lub do wykorzystania ustalonego nakładu obliczeń.
Dla przedsiębiorcy to zachęta do sprawdzenia, kiedy dodatkowy wysiłek rzeczywiście poprawia wynik. Analiza nietypowego zapytania zakupowego może uzasadniać kolejne próby. Przy prostym sprawdzeniu dostępności lepiej z góry określić moment przerwania działania i sposób przekazania sprawy dalej.
Własny projekt warto uzupełnić o górny limit wydatków oraz jednoznaczne kryterium zakończenia. Agent, który długo pracuje, powinien dostarczać sprawdzalny postęp. Gdy kolejne próby powtarzają ten sam błąd, potrzebna jest informacja o przyczynie i brakujących danych.
Od czego zacząć w swojej firmie
Wybierz powtarzalną czynność, wskaż osobę odpowiedzialną za jej wynik i opisz warunki odbioru. Następnie przygotuj próbę na rzeczywistych sprawach, obejmującą również braki danych i sprzeczne polecenia. Dopiero taki sprawdzian pokaże, czy zespół odzyskuje czas, czy przenosi go na pilnowanie programu.
Pierwszą wersję rozwiązania można rozważyć także wśród aplikacji tworzonych z pomocą AI bez samodzielnego programowania. Warto jednak zachować te same wymagania dotyczące danych, uprawnień i oceny jakości. Łatwość budowy nie zwalnia z ustalenia, co oznacza dobrze wykonana praca.
Rozszerzaj zakres dopiero wtedy, gdy potrafisz pokazać koszt poprawnie zakończonej sprawy i wyjaśnić najczęstsze błędy. W ten sposób wiedza zdobyta podczas próby zostaje w firmie. Kolejne decyzje o modelu, narzędziach i stopniu samodzielności agenta mają już konkretne uzasadnienie.
O opłacalności decyduje koszt doprowadzenia sprawy do końca: wraz z poprawkami, nadzorem i obsługą wyjątków.
Łatwość budowy nie zwalnia z ustalenia, co oznacza dobrze wykonana praca.

Źródła
- Y Combinator — dlaczego otoczenie agenta ma znaczenie dla skuteczności modelu — Y Combinator, 7 września 2026 r., YC Paper Club. Znaczenie oprogramowania sterującego agentem: od 00:00; prezentacja QM przez Josha France’a i Regana Bella: od 45:58; budżety przypisane do celów: od 57:16; kontekst społeczny i uprawnienia: od 58:50.
Innohub TV
Zobacz tę treść także w Innohub TV
Wybraliśmy dla Ciebie klipy z Innohub TV, które rozwijają ten sam temat.
