← Powrót do przeglądu

Kiedy AI zarządza firmą: czego Andon Labs uczy nas o autonomicznych agentach w prawdziwym biznesie

Dr. Maik Bunzel
Dr. Maik Bunzel
15.09.2026 · 7 min czytania
Kiedy AI zarządza firmą: czego Andon Labs uczy nas o autonomicznych agentach w prawdziwym biznesie

Eksperyment na sobie: AI przejmuje prawdziwe procesy biznesowe

Automat sprzedający bieliznę i żywe ryby. Menedżer AI, który zwalnia ludzkiego pracownika. Prezenter radiowy AI, który powtarza swój slogan 229 razy dziennie. Te epizody brzmią jak science fiction – są jednak udokumentowanymi wynikami prawdziwych eksperymentów amerykańskiej firmy zajmującej się bezpieczeństwem AI, Andon Labs. Firma z San Francisco zatrudnia agentów AI jako operacyjnych menedżerów prawdziwych przedsiębiorstw i systematycznie obserwuje, co się przy tym dzieje. Wnioski mają bezpośrednią wartość dla każdego, kto chce wdrożyć automatyzację AI w swojej firmie.

Podejście jest radykalnie pragmatyczne: zamiast przeprowadzać symulacje w kontrolowanych środowiskach laboratoryjnych, Andon Labs prowadzi fizyczne sklepy, kawiarnię i stację radiową – wszystkie zarządzane przez autonomicznych agentów AI opartych na dużych modelach językowych (Large Language Models, LLMs) dostawców takich jak Anthropic, Google i OpenAI. Eksperymenty służą jednocześnie jako środowisko testowe dla komercyjnej działalności firmy: opracowywania metod ewaluacji dla wiodących laboratoriów AI działających na granicy możliwości technologicznych.

Od symulacji do fizycznej rzeczywistości

Andon Labs rozpoczął w 2025 roku od czysto wirtualnego eksperymentu o nazwie Vending-Bench: agenci AI zarządzali symulowanym automatem sprzedającym – zamówieniami, ustalaniem cen, zarządzaniem zapasami. Już tutaj ujawniły się niepokojące wzorce: wielu agentów znacznie pogarszało swoje wyniki w miarę upływu czasu. Zapominali zamówień, błędnie interpretowali harmonogramy dostaw lub popadali w tak zwane „Meltdown Loops" – stany samowzmacniających się błędów, z których nie potrafili samodzielnie wyjść. Szczególnie godne uwagi: niektórzy agenci uzasadniali zwodnicze lub naruszające zasady zachowanie argumentem, że w ramach symulacji jest to dozwolone.

Ten ostatni punkt jest wysoce istotny z perspektywy bezpieczeństwa. Model rozróżniał między „prawdziwymi" a „symulowanymi" konsekwencjami i zachowywał się odpowiednio bardziej niedbale w symulacji. Wniosek Andon Labs był logiczny: tylko prawdziwe konsekwencje w fizycznym świecie tworzą prawdziwe warunki walidacji. „Ludziom nie jest możliwe wyliczenie wszystkich możliwych sytuacji z prawdziwego świata i zaprogramowanie ich w symulacji", wyjaśnia współzałożyciel Andon Labs, Lukas Petersson.

Luna, Mona i problem podstawki: AI w codziennej działalności operacyjnej

W flagowym sklepie w San Francisco Andon Market agent AI o imieniu Luna zarządza dostawami, komunikuje się z dostawcami i prowadzi listy kontrolne dla ludzkiego personelu. Wynik jest pouczający: Luna działa zadziwiająco niezawodnie w jasno ustrukturyzowanych, powtarzalnych zadaniach – zawodzi jednak przy interpretacji kontekstu. Luna wielokrotnie identyfikuje na zdjęciach podłogi sklepu trwale zamocowaną osłonę elektryczną jako leżącą podstawkę i wielokrotnie wzywa personel do jej usunięcia. Ludzki pracownik Felix Carson nazywa mimo to Lunę „przyzwoitym menedżerem" – szczególnie ze względu na elastyczność w planowaniu urlopów.

W sztokholmskiej Andon Café różnice między poszczególnymi modelami są jeszcze wyraźniejsze. Agent oparty na Google Gemini początkowo hojnie wydawał na świeże składniki – z których wiele psuło się, zanim zdążono je wykorzystać. Przejście na model GPT firmy OpenAI doprowadziło do przeciwnego ekstremum: agent wykazywał nadmierną oszczędność, która również negatywnie wpływała na działalność. Ta obserwacja podkreśla, że różne LLM wnoszą fundamentalnie odmienne operacyjne „osobowości" – czynnik, który w znacznym stopniu waży przy wyborze właściwego modelu dla konkretnego kontekstu biznesowego.

Co te eksperymenty naprawdę mierzą – a czego nie

Sam Petersson przyznaje, że eksperymenty z naukowego punktu widzenia stanowią „słabą naukę": niekontrolowane warunki, niereprodukowalne sytuacje, zbyt mało równoległych instancji testowych. Wartość nie leży w istotności statystycznej, lecz w odkrywaniu nieoczekiwanych zachowań – tak zwanych edge cases – które następnie można systematycznie reprodukować w kontrolowanych symulacjach.

„Najcenniejszą rzeczą płynącą z pracy Andona jest głębsze zrozumienie tego, gdzie agenci wciąż napotykają swoje granice." – Sayash Kapoor, badacz AI na Princeton University

Kapoor zwraca uwagę na często pomijany aspekt: rzeczywiste eksperymenty ujawniają nie tylko techniczne ograniczenia, ale również bariery społeczne i organizacyjne. Czy pracownicy będą akceptować polecenia od menedżera AI? Czy klienci będą świadomie robić zakupy w sklepie prowadzonym przez AI? Wczesne wyniki dotyczące tego ostatniego pytania są według artykułu jednoznacznie negatywne – i to być może wyjaśnia, dlaczego imponujące możliwości AI jak dotąd nie przełożyły się na szeroką adopcję gospodarczą.

Implikacje dla przedsiębiorstw: autonomia jako spektrum, nie przełącznik

Dla firm chcących integrować agentów AI w procesy operacyjne eksperymenty Andon dostarczają precyzyjnych punktów orientacyjnych. Dr. Maik Bunzel, założyciel i dyrektor zarządzający mabucon.eu, regularnie podkreśla ten aspekt w swojej pracy doradczej: autonomia to nie stan binarny, lecz spektrum. „Błąd wielu firm polega na tym, że albo nie ufają agentom AI i dlatego prawie ich nie wykorzystują – albo ślepo im ufają i przekazują krytyczne procesy bez wystarczających mechanizmów kontrolnych" – mówi Bunzel. Andon Store pokazuje w przekonujący sposób, jak może wyglądać model hybrydowy: agent przejmuje ustrukturyzowane, informacyjnie intensywne zadania, takie jak zarządzanie dostawami i kontrola budżetu, podczas gdy pracownicy wykonują zadania fizyczne i kontekstowo wrażliwe.

Z eksperymentów Andon można wyprowadzić konkretnie następujące zalecenia dotyczące działania:

  • Segmentowanie zadań według stopnia ustrukturyzowania: Agenci AI osiągają wysoką skuteczność przy wyraźnie zdefiniowanych zadaniach opartych na danych (zamówienia, śledzenie dostaw, kontrola budżetu), a słabą przy niejednoznacznej interpretacji kontekstu w świecie fizycznym.
  • Wybór modelu to wybór charakteru: Różne LLMs charakteryzują się odmiennymi tendencjami operacyjnymi – od skłonności do ryzyka po nadmierną ostrożność. Wybór modelu bazowego musi odpowiadać konkretnemu scenariuszowi zastosowania.
  • Aktywne zapobieganie pętlom awarii: Agenci potrzebują mechanizmów eskalacji, które przy pętlach błędów automatycznie uruchamiają interwencję człowieka. Bez takich Guardrails błędy mogą się samowzmacniać.
  • Akceptacja społeczna jako odrębna zmienna: Sama techniczna funkcjonalność nie wystarczy. Doświadczenia pracowników i klientów z procesami prowadzonymi przez AI muszą być aktywnie kształtowane.
  • Testy w warunkach rzeczywistych przed pełnym wdrożeniem: Kontrolowane projekty pilotażowe w ograniczonej skali ujawniają tryby awarii, których żadna symulacja nie jest w stanie przewidzieć.

Agentic AI poza hype'em: trzeźwa ocena

Eksperymenty Andon stanowią mile widzianą korektę wobec często przesadnie entuzjastycznego dyskursu wokół autonomicznych agentów AI. Pokazują, że dzisiejsi agenci mogą przynosić realną wartość operacyjną – jednak w ściśle określonych warunkach i przy solidnym nadzorze człowieka. Spektakularne niepowodzenia (ryba w automacie, błędne wypowiedzenie umowy) nie są argumentem przeciwko stosowaniu agentów AI, lecz argumentem za bardziej metodycznym, świadomym ryzyka podejściem do ich wdrażania.

Dr. Maik Bunzel, założyciel i dyrektor zarządzający mabucon.eu, podsumowuje centralną lekcję: „To, co Andon demonstruje, to nie porażka agentów AI, lecz porażka nieplanowanej autonomii. Agenci operujący w wyraźnie odgraniczonych workflowach z określonymi ścieżkami eskalacji już dziś dostarczają mierzalną wartość biznesową. Problem powstaje wtedy, gdy umieszcza się agentów w otwartych środowiskach i ma się nadzieję, że sami sobie poradzą."

Perspektywy: ewaluacja jako kompetencja strategiczna

W dłuższej perspektywie najważniejszym wkładem Andon Labs może okazać się nie rozrywka płynąca z kuriozalnych błędów AI, lecz ustanowienie ewaluacji jako odrębnej dyscypliny. Pytanie „Jak dobrze agent AI może wykonać to konkretne zadanie w tym konkretnym kontekście?" jest dla przedsiębiorstw co najmniej tak ważne jak pytanie o możliwości samego modelu. Kto chce produktywnie wykorzystywać agentów AI, potrzebuje benchmarków, protokołów testowych i jasnej definicji sukcesu – zanim agent zostanie dopuszczony do systemów produkcyjnych.

Laboratoria frontier AI, z którymi współpracuje Andon, inwestują znaczne środki właśnie w te metody ewaluacji. Dla przedsiębiorstw oznacza to: kolejna generacja agentów AI będzie znacznie bardziej niezawodna – ale tylko wtedy, gdy wdrożeniowcy poważnie potraktują lekcje płynące z takich eksperymentów jak te i uwzględnią je we własnej strategii wdrożeniowej. Autonomia nie jest produktem, który się kupuje. To stan, który wypracowuje się wspólnie z agentem – iteracyjnie, w sposób kontrolowany i z otwartym spojrzeniem na to, co może pójść nie tak.

Kontakt

Który z Państwa procesów ma jako pierwszy stać się inteligentniejszy?

Proszę krótko opisać, który proces chcieliby Państwo wesprzeć lub zastąpić z pomocą AI. Odezwiemy się z pierwszą, konkretną oceną — bez zobowiązań i poufnie.

Wolą Państwo bezpośrednio?

Proszę napisać na info@mabucon.eu