Zagadnienie tego, w jaki sposób agent AI podejmuje kolejne decyzje, dotyczy samego rdzenia jego architektury. U podstaw leży tak zwana pętla odbieranie–układanie planu–wykonywanie, w której program najpierw odbiera informacje z otoczenia, następnie rozkłada na czynniki dostępne możliwości, a wreszcie wykonuje wybraną akcję. Cały ten cykl powtarza się kilkakrotnie, aż do uzyskania zamierzonego efektu.
Sercem tego procesu jest model językowy, który pełni rolę wewnętrznego głosu doradczego agenta. To on interpretuje polecenia użytkownika, rozbija złożone zadanie na mniejsze podzadania i sugeruje kolejność ich realizacji. Otoczenie modelu stanowią dodatkowe narzędzia – wyszukiwarki, kalkulatory, interfejsy API – które agent uruchamia wtedy, gdy wymaga precyzyjnych danych spoza swojej wiedzy treningowej.
Interesującym elementem architektury jest tak zwana pamięć operacyjna, w której agent przechowuje kontekst bieżącego zadania. Dzięki niej nie traci nici nawet wtedy, gdy procedura rozkłada się na kilka etapów i wymaga przełączania między różnymi źródłami informacji. To dokładnie ta zdolność wyróżnia agenta od podstawowego skryptu, który wykonuje jedynie wcześniej ustaloną listę poleceń.
Oddzielną sprawą pozostaje mechanizm oceny własnych działań. Odpowiednio zbudowany agent jest w stanie rozpoznać, że otrzymany wynik nie zgadza się od zamierzonego, i cofnąć się do wcześniejszego etapu, by spróbować innej ścieżki. Taka autokorekta zbliża działanie maszyny do ludzkiego nawyku weryfikowania własnej pracy przed jej oddaniem.