Webinar Claude · 29.09, 19:00Zapisz się
Narzędzia AI

Co to jest Hermes Agent i jak działa?

Bartłomiej Bernat16.08.202612 min czytania

Co to jest Hermes Agent?

Hermes Agent to otwartoźródłowy agent AI stworzony przez Nous Research, udostępniony na licencji MIT. Jego wyróżnikiem jest wbudowana pętla uczenia: agent tworzy własne umiejętności na podstawie wykonanych zadań, poprawia je w trakcie używania, sam przypomina sobie o zapisaniu ważnych ustaleń i przeszukuje swoje wcześniejsze rozmowy. Z każdą sesją buduje dokładniejszy model tego, z kim rozmawia.

Hermes nie jest przywiązany do jednego komputera. Możesz uruchomić go na serwerze VPS za kilka dolarów miesięcznie, na klastrze GPU albo na infrastrukturze serverless, która niemal nic nie kosztuje w czasie bezczynności. Rozmawiać z nim da się z terminala, ale też z Telegrama, Discorda czy Slacka, podczas gdy sam agent pracuje na maszynie w chmurze.

Nie jest to model językowy, tylko nakładka, która modele wykorzystuje. Podłączysz do niego dowolnego dostawcę: Nous Portal, OpenRouter, OpenAI, własny endpoint i wiele innych. Zmiana modelu to jedno polecenie hermes model, bez ingerencji w kod i bez przywiązania do konkretnego dostawcy.

Hermes bywa porównywany z OpenClaw, drugim znanym projektem osobistego agenta open source, i potrafi automatycznie przejąć konfigurację po nim. Poza wersją terminalową dostępny jest także Hermes Desktop.

Jak działa Hermes Agent?

Hermes działa w pętli: przyjmuje polecenie, planuje kroki, wywołuje narzędzia, ocenia wynik i powtarza cykl aż do wykonania zadania. Sam w sobie nie generuje tekstu. Rozumowanie zleca podłączonemu modelowi, a jego własną rolą jest orkiestracja: co uruchomić, w jakiej kolejności, z jakim kontekstem i co zapamiętać.

Do dyspozycji ma ponad czterdzieści narzędzi pogrupowanych w zestawy, które można włączać i wyłączać komendą hermes tools. Obsługuje protokół MCP, więc podłączysz do niego dowolny zewnętrzny serwer MCP i rozszerzysz zakres jego działania bez pisania integracji.

Polecenia systemowe wykonuje przez jeden z siedmiu backendów terminalowych: lokalny, Docker, SSH, Singularity, Modal, Daytona i Vercel Sandbox. Wybór backendu decyduje o tym, gdzie fizycznie dzieje się praca i jak mocno jest odizolowana od twojego systemu. Daytona i Modal oferują trwałość w modelu serverless: środowisko agenta hibernuje, gdy nikt z niego nie korzysta, i budzi się na żądanie, więc między sesjami koszt jest bliski zeru.

Przy złożonych zadaniach Hermes potrafi uruchamiać odizolowanych podagentów pracujących równolegle nad osobnymi wątkami. Może też pisać skrypty w Pythonie, które wywołują narzędzia przez RPC, dzięki czemu wieloetapowy proces zamyka się w jednej turze bez obciążania kontekstu.

Jakie są kluczowe funkcje Hermes Agent?

Zamknięta pętla uczenia. Po trudniejszym zadaniu agent sam tworzy z niego umiejętność, czyli plik SKILL.md z nazwą, opisem i procedurą krok po kroku. Przy kolejnych zadaniach czyta same opisy, a pełną treść wczytuje dopiero wtedy, gdy umiejętność faktycznie jest potrzebna, więc rosnąca biblioteka nie rozdyma każdego zapytania. Format jest zgodny z otwartym standardem agentskills.io, co pozwala wymieniać się skillami z innymi użytkownikami.

Pamięć między sesjami. Agent prowadzi dwa pliki: MEMORY.md z własnymi notatkami o środowisku i konwencjach oraz USER.md z profilem użytkownika. Oba mają twarde limity długości, po ok. 2200 i 1375 znaków, żeby nie zjadały kontekstu. Głębszą pamięć zapewnia osiem wtyczek zewnętrznych, wśród nich Honcho, Mem0 i Supermemory.

Prawdziwy interfejs terminalowy. Pełny TUI z edycją wielolinijkową, podpowiadaniem slash-commandów, historią rozmów, przerywaniem pracy w locie i strumieniowanym wyjściem narzędzi.

Obecność tam, gdzie piszesz. Telegram, Discord, Slack, WhatsApp, Signal, e-mail, Microsoft Teams, Home Assistant i terminal, wszystko z jednego procesu bramy. Rozmowa zachowuje ciągłość między platformami, a wiadomości głosowe są transkrybowane.

Zaplanowane automatyzacje. Wbudowany harmonogram w stylu crona z dostarczaniem wyników na dowolną platformę. Zadania definiuje się zwykłym językiem.

Praca badawcza. Hermes potrafi masowo generować trajektorie działania i je kompresować, co służy trenowaniu kolejnych modeli wywołujących narzędzia.

Jak zainstalować i skonfigurować Hermes Agent?

Instalacja sprowadza się do jednego polecenia. Na Linuksie, macOS, WSL2 i Termuksie:

curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash

Na Windowsie Hermes działa natywnie, bez WSL. W PowerShellu:

iex (irm https://hermes-agent.nousresearch.com/install.ps1)

Instalator sam dociąga wszystko, czego potrzeba: menedżer uv, Pythona 3.11, Node.js, ripgrep, ffmpeg oraz przenośną wersję Git Basha, która nie rusza systemowej instalacji Gita i nie wymaga uprawnień administratora. Po instalacji wystarczy przeładować powłokę i wpisać hermes, żeby zacząć rozmowę.

Wymagania sprzętowe są niskie, bo Hermes nie uruchamia modelu u siebie. Liczy się przede wszystkim dostęp do endpointu API i stabilne łącze. Realnie wystarczy VPS za około pięć dolarów miesięcznie, a przy backendach serverless nawet to odpada w czasie bezczynności.

Konfigurację najszybciej przejść kreatorem hermes setup, który przeprowadza przez wszystkie ustawienia naraz. Jeśli nie chcesz zbierać osobnych kluczy do modelu, wyszukiwarki, generatora obrazów i syntezy mowy, użyj wariantu hermes setup --portal. Loguje on przez OAuth do Nous Portal, ustawia go jako dostawcę i włącza Tool Gateway, w którym dostępne są między innymi wyszukiwanie internetowe, generowanie obrazów, synteza mowy i przeglądarka w chmurze. Stan konfiguracji sprawdzisz przez hermes portal info, a własne klucze możesz podstawić osobno dla każdego narzędzia.

Ustawienia trzymane są w pliku ~/.hermes/config.yaml. Zmiany zaczynają obowiązywać od razu, bez restartu sesji.

Jakie narzędzia i komendy oferuje interfejs terminalowy?

Podstawowe komendy uruchamiane z powłoki:

hermes otwiera interaktywną rozmowę, hermes model wybiera dostawcę i model, hermes tools włącza i wyłącza zestawy narzędzi, hermes config set oraz hermes config get operują na pojedynczych ustawieniach, hermes gateway startuje bramę do komunikatorów, hermes setup uruchamia pełnego kreatora, hermes claw migrate przenosi konfigurację z OpenClaw, hermes update aktualizuje instalację, a hermes doctor diagnozuje problemy.

Wewnątrz rozmowy działają slash-commandy, w większości wspólne dla terminala i komunikatorów. /new lub /reset zaczyna rozmowę od nowa, /model zmienia model w locie, /personality przełącza osobowość agenta, /retry i /undo cofają ostatnią turę, /compress skraca kontekst, /usage i /insights pokazują zużycie, a /skills przegląda dostępne umiejętności. Pracę przerywa się skrótem Ctrl+C w terminalu lub komendą /stop na komunikatorze.

Warto znać /yolo, który wyłącza pytania o zgodę na czas sesji. Hermes sygnalizuje ten tryb czerwonym bannerem, bo łatwo o nim zapomnieć.

Jak Hermes Agent automatyzuje zadania?

Sercem automatyzacji jest wbudowany harmonogram. Zadania cykliczne opisuje się zwykłym językiem, a nie składnią crona, i wskazuje, gdzie ma trafić wynik. Dzienny raport na Telegram, nocna kopia zapasowa, cotygodniowy audyt katalogu z projektami: wszystko działa bez nadzoru, a rezultat przychodzi tam, gdzie i tak zaglądasz.

Drugim filarem jest dostęp do systemu i narzędzi. Hermes czyta i zapisuje pliki, uruchamia polecenia w wybranym backendzie, wywołuje zewnętrzne API i korzysta z serwerów MCP. Dzięki temu automatyzacja nie kończy się na wysłaniu wiadomości, tylko realnie coś wykonuje.

Przy większych zadaniach wchodzi delegowanie. Agent uruchamia podagentów pracujących równolegle nad osobnymi fragmentami, a sam zbiera wyniki. Może też napisać skrypt w Pythonie wywołujący narzędzia przez RPC, co zamienia wieloetapowy proces w jedno przejście.

W pracy projektowej sprawdza się to przy przypomnieniach o terminach, cyklicznych podsumowaniach statusu i zbieraniu ustaleń z rozmów. Pamięć trwała sprawia, że agent pamięta wcześniejsze decyzje, więc nie trzeba mu za każdym razem tłumaczyć kontekstu projektu.

Jak działa pętla samouczenia i pamięć między sesjami?

To właśnie ta pętla jest głównym argumentem Hermesa i warto rozłożyć ją na cztery mechanizmy.

Tworzenie umiejętności. Po wykonaniu złożonego zadania agent zapisuje z niego procedurę jako SKILL.md. Następnym razem nie odkrywa rozwiązania od zera, tylko sięga po gotowy przepis. Umiejętności poprawiają się w trakcie kolejnych użyć.

Kuratorowana pamięć z przypomnieniami. Agent okresowo dostaje bodziec, żeby przejrzeć rozmowę i zapisać to, co warto zachować na stałe. Notatki lądują w MEMORY.md i USER.md, które trafiają do kontekstu każdej rozmowy, dlatego mają narzucone limity długości.

Przeszukiwanie wcześniejszych sesji. Wszystkie rozmowy, zarówno z terminala, jak i z komunikatorów, trafiają do bazy SQLite w ~/.hermes/state.db z indeksem pełnotekstowym FTS5. Gdy pytasz „o czym rozmawialiśmy w zeszłym tygodniu", agent przeszukuje własną historię narzędziem session_search. Zapytanie zajmuje około 20 milisekund, więc odpowiedź przychodzi bez odczuwalnej zwłoki.

Podział ról jest tu istotny. Pamięć trwała trzyma fakty, które zawsze mają być pod ręką, a wyszukiwanie sesji służy do sięgania po szczegóły sprzed tygodni. Trzymanie wszystkiego w pamięci stałej rozdęłoby każde zapytanie.

Modelowanie użytkownika. Wtyczka Honcho buduje obraz preferencji i sposobu pracy użytkownika metodą dialektyczną, na podstawie tego, co faktycznie dzieje się w rozmowach. To ona odpowiada za wrażenie, że agent z czasem lepiej trafia w oczekiwania.

Jak Hermes Agent integruje się z Telegramem, Discordem i innymi platformami?

Za obecność na komunikatorach odpowiada brama uruchamiana poleceniem hermes gateway. Jeden proces obsługuje wszystkie podłączone platformy: Telegram, Discord, Slack, WhatsApp, Signal, e-mail, Microsoft Teams i Home Assistant. Konfigurację przeprowadza hermes gateway setup, a start hermes gateway start.

Praktyczna korzyść jest taka, że agent przestaje być programem, który trzeba mieć otwarty na własnym komputerze. Zlecasz zadanie z telefonu przez Telegram, a Hermes wykonuje je na serwerze i odsyła wynik na ten sam czat. Rozmowa zachowuje ciągłość między kanałami, więc wątek zaczęty w terminalu można dokończyć na komunikatorze.

Na komunikatorach działa większość slash-commandów znanych z terminala, więc nie trzeba uczyć się drugiego zestawu poleceń. Nagrania głosowe są transkrybowane, a lokalna transkrypcja przez faster-whisper jest darmowa. Do tego dochodzi kierowanie wyników zaplanowanych zadań na wybraną platformę.

Jak zapewnione jest bezpieczeństwo korzystania z Hermes Agent?

Agent z dostępem do terminala i twoich plików to realne ryzyko, więc Hermes stosuje ochronę wielowarstwową. Kolejne warstwy obejmują autoryzację użytkowników, zatwierdzanie niebezpiecznych poleceń, zabezpieczenia zapisu plików, izolację kontenerową, filtrowanie danych uwierzytelniających przekazywanych do serwerów MCP, rozdzielenie sesji oraz walidację parametrów przekazywanych do powłoki.

Zatwierdzanie poleceń ustawia się w ~/.hermes/config.yaml w sekcji approvals. Tryb smart pyta tylko przy operacjach uznanych za niebezpieczne, manual przy każdej z nich, a off wyłącza pytania całkowicie. Domyślny czas oczekiwania na odpowiedź to 300 sekund. Osobno konfiguruje się zachowanie zadań cyklicznych, które domyślnie odmawiają wykonania niebezpiecznego polecenia zamiast czekać na nikogo.

Twarda lista blokad działa poniżej wszystkich pozostałych ustawień. Obejmuje operacje nieodwracalne i zatrzymuje je, zanim warstwa zatwierdzania w ogóle je zobaczy. Nie da się jej wyłączyć ani trybem off, ani --yolo. Jej edytowalnym odpowiednikiem jest lista approvals.deny, w której własnymi wzorcami blokujesz konkretne komendy na stałe, niezależnie od pozostałych ustawień. To pozwala pracować w trybie swobodnym, ale z twardymi wyjątkami.

Kontrola dostępu na komunikatorach opiera się na listach dozwolonych użytkowników i parowaniu rozmów prywatnych, żeby przypadkowa osoba nie wydała agentowi polecenia. Izolacja kontenerowa przez Dockera, Singularity czy Modala oddziela wykonywane komendy od systemu gospodarza.

Warto pamiętać, że domyślne ustawienia chronią sensownie, ale to użytkownik decyduje, ile swobody daje agentowi. Tryb off i --yolo istnieją i bywają kuszące, zwłaszcza przy dłuższych zadaniach.

Hermes Agent vs OpenClaw: różnice i migracja

Oba projekty realizują ten sam pomysł osobistego agenta open source, który działa na twojej infrastrukturze i odzywa się na komunikatorach. Różnica leży w akcencie: Hermes stawia na zamkniętą pętlę uczenia, czyli samodzielne tworzenie umiejętności, kuratorowaną pamięć i modelowanie użytkownika. Dochodzi do tego zaplecze Nous Research: Nous Portal z jedną subskrypcją zamiast pięciu kluczy API oraz zgodność ze standardem agentskills.io.

Migracja z OpenClaw jest zautomatyzowana i to jeden z mocniejszych argumentów za spróbowaniem Hermesa. Kreator hermes setup sam wykrywa katalog ~/.openclaw i proponuje przeniesienie konfiguracji, zanim zacznie pytać o cokolwiek innego. Można ją też uruchomić w dowolnym momencie:

hermes claw migrate przeprowadza migrację interaktywnie, hermes claw migrate --dry-run pokazuje, co zostałoby przeniesione, bez wprowadzania zmian, hermes claw migrate --preset user-data pomija sekrety, a hermes claw migrate --overwrite nadpisuje konflikty.

Przeniesieniu podlegają plik persony SOUL.md, wpisy z MEMORY.md i USER.md, samodzielnie napisane skille, lista zatwierdzonych komend, ustawienia komunikatorów wraz z listami dozwolonych użytkowników, klucze API z listy dozwolonych oraz pliki audio. Dla osób, które wolą przejść przez to rozmową, przygotowano skill openclaw-migration z podglądem zmian przed ich zatwierdzeniem.

Wybór między projektami zależy głównie od tego, czy zależy ci na pętli samouczenia. Jeśli tak, Hermes nie ma tu bezpośredniej konkurencji. Jeśli masz działającą konfigurację OpenClaw, próba nic nie kosztuje, bo --dry-run pokaże skutki przed ich wprowadzeniem.

Ile kosztuje uruchomienie Hermes Agent?

Sam Hermes jest darmowy, na licencji MIT. Płacisz za trzy rzeczy wokół niego.

Model językowy. To główna pozycja rachunku. Możesz podłączyć własny klucz do OpenAI, Anthropica czy OpenRouter i płacić za zużycie tokenów, wskazać własny endpoint albo wykupić subskrypcję Nous Portal, która obejmuje ponad 300 modeli oraz Tool Gateway z wyszukiwaniem, generowaniem obrazów, syntezą mowy i przeglądarką w chmurze. Portal upraszcza rozliczenia, bo zastępuje kilka osobnych kont.

Infrastruktura. Na własnym komputerze koszt jest zerowy. VPS wystarczy najtańszy, rzędu pięciu dolarów miesięcznie, bo Hermes nie liczy niczego ciężkiego lokalnie. Backendy serverless, czyli Modal i Daytona, hibernują środowisko w czasie bezczynności, więc płacisz w praktyce za czas faktycznej pracy agenta.

Narzędzia dodatkowe. Wyszukiwanie internetowe, generowanie obrazów czy transkrypcja mają własne cenniki, chyba że korzystasz z nich przez Tool Gateway. Transkrypcję można zresztą uruchomić lokalnie przez faster-whisper i wtedy nic nie kosztuje.

Praktyczny wniosek: przy zwykłym użyciu osobistym największą pozycją są tokeny modelu, a nie serwer. Warto zacząć od taniego modelu i przełączyć się na mocniejszy dopiero tam, gdzie jakość faktycznie robi różnicę, zwłaszcza że zmiana to jedno polecenie.

Jakie opinie mają użytkownicy Hermes Agent?

Najczęściej chwalona jest niezależność od jednego dostawcy. Możliwość przełączenia modelu jednym poleceniem, bez zmian w kodzie, jest realną wartością w sytuacji, gdy ceny i jakość modeli zmieniają się co kilka miesięcy.

Dobrze oceniana jest też praca poza laptopem. Zlecanie zadań z telefonu przez Telegram, podczas gdy agent pracuje na maszynie w chmurze, to scenariusz, który wielu użytkowników wymienia jako powód przejścia z narzędzi działających tylko lokalnie.

Pętla samouczenia budzi największe zainteresowanie, ale i najwięcej ostrożności. Jakość automatycznie tworzonych umiejętności zależy od modelu, który za nimi stoi, więc na słabszym modelu efekty bywają nierówne. Podobnie z pamięcią: przy niedbałej konfiguracji agent zapisuje rzeczy, które niekoniecznie warto pamiętać.

Wśród zastrzeżeń wraca próg wejścia. Instalacja jest jednym poleceniem, ale sensowne skonfigurowanie zatwierdzania komend, backendu terminala i bramy komunikatorów wymaga rozumienia, co się właściwie dzieje. Hermes jest narzędziem dla osób technicznych i nie udaje inaczej. Pojawiają się też uwagi o tempie zmian, typowe dla młodego projektu rozwijanego intensywnie.

Bartłomiej Bernat

Bartłomiej Bernat

Head of Sales

Łączy marketing ze sprzedażą i dodatkowo polewa to sosikiem mocy AI.