Roger

Bitcoin · Macro · AI · Freedom Tech
← All writing

Hermes Agent auf eigener Hardware: agentische KI, ohne das Geschäft aus der Hand zu geben

Wie man den Hermes Agent auf eigener Hardware betreibt, warum ein lokales Modell dafür nicht ausreicht und warum gemietete Intelligenz die vernünftige Hälfte des Geschäfts ist.

30 Sep 2026 5,037 words · 22 min Also on Nostr as a long-form note
Hermes Agent auf eigener Hardware: agentische KI, ohne das Geschäft aus der Hand zu geben

Was es braucht, um einen Agenten auf eigener Hardware laufen zu lassen, warum ein lokales Modell diese Aufgabe nicht erfüllt und warum gemietete Intelligenz die vernünftige Hälfte des Geschäfts ist.

Das Nützlichste, was ich diese Woche über agentische KI gehört habe, war ein Mann, der seinem Rechner befahl, einen anderen Rechner zu installieren.

Ein Mann in Philadelphia wird gefragt, was er tut, wenn er nachdenken muss. Von Beruf führt er ein Medienunternehmen. Er hält einen Agenten auf einer gemieteten Maschine am Laufen, und gleich zu Beginn des Gesprächs beichtet er etwas Kleines und Seltsames: Als der Gast den Raum betrat, war der Gastgeber am Telefon. Am anderen Ende war niemand. Er lief durch sein Viertel und erklärte seinem Agenten, wie er den Newsletter des Tages aufgebaut haben wollte.

Später sagt er den Satz, der hängen bleibt. Vier Monate lang hatte er am vorherigen Aufbau gearbeitet und den gesamten Arbeitsablauf seiner Firma dorthin verlegt. Dann riet ihm jemand, etwas anderes auszuprobieren.

Also öffnete er an einem Sonntagnachmittag seinen bestehenden Agenten in Telegram. Er tippte: „Hey, starte einen Hermes-Agenten auf deinem Rechner und sag mir Bescheid, wenn es fertig ist.“

Vierundzwanzig Stunden Einrichtung später tippte er: „Hermes-Agent, fahre den Open-Claw-Agenten herunter, wir fangen jetzt an zu arbeiten.“

Das ist die ganze Geschichte in Kurzform. Kein Modell, das bessere Absätze schreibt. Eine Maschine, die eine zweite Maschine installiert, ganz allein, weil man sie in einer Textnachricht darum gebeten hat. Das Programm, zu dem er gewechselt ist, heißt Hermes Agent. Dieser Text handelt davon, wie es läuft, was es kostet und wo die Intelligenz dahinter liegen sollte.

Ein stilles Arbeitszimmer in der Dämmerung. Ein kleiner Rechner steht allein da, sein kleines Licht leuchtet.
Ein stilles Arbeitszimmer in der Dämmerung. Ein kleiner Rechner steht allein da, sein kleines Licht leuchtet.

Die Grenze, die die meisten noch nicht überschritten haben

Die große Mehrheit der Menschen nutzt künstliche Intelligenz wie ein schnelleres Suchfeld. Im selben Gespräch trifft der Gast aus dem Labor, das den Hermes Agenten baut, eine Unterscheidung, die sich festzuhalten lohnt. Seine eigene Mutter, erzählt er, liebt eine bekannte Antwortmaschine und benutzt sie ständig. Sie mag sie, weil sie eine schönere Version eines Suchfelds ist. Das ist keine Kritik an ihr. Es beschreibt nur, wo die große Menge steht.

Die Grenze wird an einer anderen Stelle überschritten. Ein Textfeld im Browser liefert eine Antwort und wartet dann. Ein Agent liefert ein Ergebnis, und die Arbeit war erledigt, während man selbst woanders war. Er hat die Datei gelesen, den Befehl ausgeführt, die Ausgabe geprüft und den Fehler vom ersten Versuch korrigiert. Danach hat er aufgeschrieben, wie er es gemacht hat, damit er die Arbeit am nächsten Dienstag wiederholen kann. Der Unterschied liegt nicht in der Qualität der Absätze. Der Unterschied ist, dass eines von beiden weiterarbeitet, nachdem man das Fenster geschlossen hat.

Und hier hören fast alle auf, denn der ehrliche Einwand ist nicht Bequemlichkeit. Das Hindernis ist das Risiko. Gibt ein Chatbot eine falsche Antwort, verliert man eine Minute. Gibt ein Agent mit Zugriff auf die eigenen Dateien, Konten und den eigenen Rechner eine falsche Antwort, verliert man etwas, das nicht zurückkommt.

Die interessante Frage lautet also nicht mehr, ob agentische Systeme beeindruckend sind. Die eigentliche Frage ist, was sie sicher genug macht, um sie in Betrieb zu nehmen. Die Antwort ist struktureller Natur, und sie ist nicht technisch. Es geht nicht darum, einfach fester zu vertrauen.

Es ist auch nicht die Antwort, die die meisten erwarten. Was im Netz diskutiert wird, ist die Wahl zwischen allem auf eigener Hardware und allem auf fremden Rechnern. Diese Gegenüberstellung ist falsch, und zwar so falsch, dass Menschen dadurch Geld an der falschen Stelle ausgeben. Diesen Knoten zu lösen, macht den größten Teil des Folgenden aus.

Was der Hermes Agent tatsächlich ist

Es lohnt sich, genau zu benennen, um welches Werkzeug es hier geht. Denn „Agent“ ist inzwischen so ein Wort, das alles bedeuten kann und deshalb nichts.

Der Hermes Agent ist ein Programm, das man selbst installiert und selbst laufen lässt. Es liegt auf einer Maschine, die man kontrolliert, und man spricht mit ihm, wie man mit einem Menschen sprechen würde: indem man tippt. Es gehört zur selben Familie wie die Programmierassistenten, die im Terminal laufen, und es unterscheidet sich in einem strukturellen Punkt von einer Website, in der man nur schreibt. Unter ihm liegt ein System, nicht bloß eine Unterhaltung. Es kann Dateien lesen und schreiben, Programme starten, einen Browser öffnen, Zeitpläne einhalten und sich mit Nachrichtendiensten verbinden. Man muss also nicht einmal am Rechner sitzen, um es zu erreichen.

Der Vorgang am Anfang dieses Textes zeigt, wie das in der Praxis aussieht. Der Gastgeber hatte seinem bestehenden Agenten aufgetragen, den neuen zu installieren, und dann nicht mehr hingesehen, weil es nichts mehr zu beaufsichtigen gab. Als er zurückkam, war die Arbeit getan.

Drei Eigenschaften sind für alles Weitere wichtig, und der Gast nennt alle drei.

Es funktioniert, sobald man es installiert. Das klingt nach schwachem Lob und ist keines. Ein großer Teil der offenen Werkzeuge in diesem Feld kommt als Sammlung von Einzelteilen daher und setzt voraus, dass man Freude am Zusammensetzen hat. Die Entscheidung war hier, den Kern klein und klar zu halten, damit schon der erste Start etwas Brauchbares liefert, und alles Weitere zum Zusatz zu machen statt zur Pflicht. Warum das für Leser zählt, ist einfach: Die Hürde zum Ausprobieren ist ein Nachmittag, kein Projekt.

Es erinnert sich, und es wird besser. Das ist der Teil, der den Umgang mit ihm verändert. Die meisten Assistenten sind ohne Gedächtnis: in einer Sitzung hervorragend, am Anfang der nächsten leer, und unberechenbar bei einer Aufgabe, die sie letzte Woche gelöst haben. Ein Agent mit dauerhaftem Gedächtnis schreibt den gefundenen Weg auf. Dieselbe Aufgabe wird beim zweiten Mal leichter und ist beim zehnten Mal verlässlich. Der Gast beschreibt den Fehler, den das behebt, sehr genau: Auf einem System, das am Montag funktioniert und sich am Dienstag nicht wiederholen kann, lässt sich nichts aufbauen. Sobald eine Aufgabe verlässlich läuft, können andere Aufgaben auf ihr aufsetzen. An diesem Punkt wird aus einem Werkzeug eine Infrastruktur.

Tausende leuchtende Punkte, verbunden zu einem dichten dreidimensionalen Netz.
Tausende leuchtende Punkte, verbunden zu einem dichten dreidimensionalen Netz.

Es ist egal, welches Modell man nutzt. Diese Eigenschaft ist für die zweite Hälfte dieses Textes die wichtigste, und sie ist eine bewusste Designentscheidung, kein technisches Detail. Der Agent ist das Gerüst (auf Englisch „Harness“), also die Hülle, die Werkzeuge, Zeitpläne und Gedächtnis bereitstellt. Das Modell ist ein separates Teil, das hineingesteckt wird. Man kann den Agenten auf ein lokales Modell richten, auf ein gemietetes Modell mit offenen Gewichten, auf ein geschlossenes Spitzenmodell oder auf mehrere zugleich für verschiedene Aufgaben — und zwischen ihnen wechseln, ohne etwas neu aufzubauen.

Wegen dieser letzten Eigenschaft kann der Rest dieses Textes davon sprechen, wo die Intelligenz lebt, als Wahl statt als Festlegung.

Ein leuchtendes kristallines Modul, in eine gefräste Fassung gesenkt; dahinter schweben weitere.
Ein leuchtendes kristallines Modul, in eine gefräste Fassung gesenkt; dahinter schweben weitere.

Es gibt noch einen vierten Punkt, der erwähnt werden sollte, weil er am wenigsten besprochen wird und am meisten darüber verrät, für wen das gebaut ist. Der Gastgeber benutzt weder ein klassisches Programm am Rechner noch ein Terminal. Er spricht mit seinem Agenten über Telegram, in einer privaten Gruppe, in der nur er und der Agent sind. Die Themenstränge der Gruppe nutzt er, um getrennte Arbeitsbereiche auseinanderzuhalten: ein Strang für den Newsletter, einer für den Geschäftsbetrieb, einer für einen Kunden. Das macht er per Stimme, während er durch sein Viertel läuft — er diktiert, statt zu tippen. Jemand aus seinem Team bevorzugt die Anwendung am Rechner und benutzt den Chat nie. Beide bedienen denselben Agenten. Es gibt nicht den einen richtigen Weg hinein, und das Werkzeug ist so gebaut, dass es keinen geben muss.

Ein einzelner kleiner, polierter Metallwürfel, allein auf einer leeren dunklen Werkbank.
Ein einzelner kleiner, polierter Metallwürfel, allein auf einer leeren dunklen Werkbank.

Drei Beine, und nur eines ist gemietet

Der Gastgeber liefert das klarste Bild der ganzen Stunde, und es lohnt sich, es nachzuzeichnen, weil es den Rest dieses Textes einfach macht.

Ein agentisches System, sagt er, steht auf drei Beinen. Das erste ist das zweite Gehirn, also die Dateien. Jede Notiz, jeder Datensatz, jedes Projekt, alles, was man über die eigene Arbeit weiß — an einem Ort, an dem der Agent es lesen kann. Das zweite ist das Gerüst, der Agent selbst: das Teil, das Werkzeuge hat, Zeitpläne einhält, sich an Gelerntes erinnert und die Maschine berühren kann. In diesem Fall ist dieses Gerüst der Hermes Agent, also das, was man installiert und behält. Das dritte ist das Modell, die Intelligenz, die die eigentliche Denkarbeit leistet.

Drei Felder: das zweite Gehirn, das Gerüst, die Modelle.
Drei Felder: das zweite Gehirn, das Gerüst, die Modelle.

Das Bild trägt seinen Nutzen, weil zwei dieser drei Beine schon einem selbst gehören — und es sind die beiden, die Jahre brauchen, bis sie stehen. Die eigene Geschichte kann einem niemand verkaufen.

Eine offene Schublade mit leeren Blättern und Karteikarten in sorgfältiger Ordnung.
Eine offene Schublade mit leeren Blättern und Karteikarten in sorgfältiger Ordnung.

Das dritte Bein — das Modell — ist das, das sich alle paar Monate ändert, und es ist das, bei dem die Menschen am meisten fürchten, ausgesperrt zu werden.

Diese Ungleichheit ist das praktische Argument für diese ganze Art von Werkzeugen. Der Gastgeber sagt es deutlich, in einem Satz, der wie ein Werbespruch klingt und in Wahrheit eine Aussage über Wechselbarkeit ist. An einen einzigen Anbieter gebunden zu sein, ist das, was man vermeiden will. Das Modell ist der Teil, den man austauschen können möchte, sobald ein besseres oder ein billigeres auftaucht. Ein Gerüst, mit dem sich das Modell wechseln lässt, ohne alles andere zu ändern, ist keine Zusatzausstattung. Es ist das, was die Investition in die anderen beiden Beine sicher macht.

Was tatsächlich aus der Hand gegeben wird

Jetzt der unangenehme Teil, und der Gast mildert ihn nicht ab.

Unternehmen schicken ihre internen Unterlagen an Modelle, die damit womöglich trainiert werden. Er nennt das ein psychologisches Phänomen: Menschen geben enorm viel preis und merken kaum, dass sie es tun. Dann formuliert er die schärfere Fassung des Arguments. Wer als Firma welcher Größe auch immer die eigenen Informationen in die Trainingsverarbeitung eines Labors einspeist, gibt genau das aus der Hand, was ihn unterscheidet. Er sagt „das geheime Rezept“. Das ist nicht niedlich gemeint. Die eigene Preislogik, die Kundenliste, die interne Methode, das angesammelte Urteilsvermögen. Das ist kein Rohstoff. Das ist das Geschäft.

Der Gastgeber geht noch einen Schritt weiter und landet bei einem Wort, das künftig wohl in vielen Vorstandsetagen fallen wird: Treuepflicht. Gemeint ist die Pflicht, im Interesse der Eigentümer zu handeln. Sein Punkt: Ein Geschäftsführer, der das geistige Eigentum der Firma an einen Anbieter schickt, der zugleich konkurrierende Produkte baut, muss diese Entscheidung womöglich irgendwann den Anteilseignern erklären. Ob daraus je ein rechtlicher Maßstab wird, ist offen — die Richtung des Drucks ist klar. Die Kosten des vollständigen Auslagerns stehen nicht auf der Rechnung. Die Rechnung kommt später, und sie kommt als verlorener Verhandlungsspielraum.

Wohin eine Anfrage geht: lokal oder gemietet.
Wohin eine Anfrage geht: lokal oder gemietet.
Ein leuchtendes Kabel verlässt ein Haus und zieht über ein dunkles Feld auf ferne, glühende Fenster zu.
Ein leuchtendes Kabel verlässt ein Haus und zieht über ein dunkles Feld auf ferne, glühende Fenster zu.

Das ist der Teil des Gesprächs, der alles andere umsetzbar macht, weil er eine Verwechslung auflöst, über die Menschen ständig stolpern. Es gibt hier nicht zwei Möglichkeiten, sondern mehrere. Sie unterscheiden sich darin, wohin eine bestimmte Sache geht: die Anfrage und alles, was daran hängt.

Eine glatte, konturlose Kugel aus bernsteinfarbenem Licht, die in einem leeren dunklen Gang schwebt.
Eine glatte, konturlose Kugel aus bernsteinfarbenem Licht, die in einem leeren dunklen Gang schwebt.

Das billigste Missverständnis in diesem Feld

Der Gast verwendet echte Zeit auf einen Einwand, dem er offensichtlich oft begegnet, und er verdient es, zitiert statt umschrieben zu werden.

Die Modelle mit offenen Gewichten, die den Preisverfall ausgelöst haben, wurden überwiegend außerhalb der USA trainiert. Das hören viele und schließen daraus, ihre Daten würden ins Ausland geschickt. Dieser Schluss ist in genau dem Fall falsch, auf den es ankommt. Sich direkt mit den Servern eines Anbieters in einem anderen Land zu verbinden, ist das eine. Dieselben offenen Gewichte herunterzuladen und auf Rechnern laufen zu lassen, die man selbst kontrolliert, ist etwas völlig anderes, denn ein Modell ist eine Datei. Und eine Datei läuft dort, wo man sie hinlegt — unter den Regeln, die dort gelten.

Er sagt es in einem Satz: Es ist ein chinesisches Modell, das auf amerikanischen Servern läuft. Das ist etwas anderes als chinesische Server. Die Datei und der Gerichtsstand sind getrennt gereist. Genauso wenig wird ein Buch in dem Land veröffentlicht, in dem es gedruckt wurde.

Was ein lokales Modell kann und was nicht

Hier wird das Gespräch konkret, und dieser Text wird es auch. Denn „lauf es selbst“ ist leicht geraten und schwer ehrlich zu beziffern. Die ehrliche Fassung beginnt mit etwas, das die Begeisterung um lokale Modelle gern überspringt.

Ein Modell, das in einen Heimrechner passt, kann die Arbeit nicht leisten, die ein Agent braucht.

Das ist keine Grenze der Software, sondern eine Grenze der Maschine. Ein Sprachmodell zu betreiben ist vor allem Arbeit an der Speicherbandbreite, nicht am Rechnen: Jedes Token — also jedes kleinste Textstück, das das Modell ausgibt — erfordert ein Lesen der Gewichte, und die Gewichte sind größer als der Speicher jeder Karte für Endkunden. Eine weit verbreitete Karte mit zwölf Gigabyte bewegt den Speicher mit etwa dreihundertsechzig Gigabyte pro Sekunde. Eine Karte, die für diese Arbeit gebaut ist, bewegt ihn mit 3,33 Terabyte pro Sekunde, also rund neunmal mehr, und sie fasst achtzig Gigabyte statt zwölf.

Vier Größenklassen von Modellen. Nur die größte kann einen Agenten antreiben.
Vier Größenklassen von Modellen. Nur die größte kann einen Agenten antreiben.

Die Folge ist unmissverständlich, und man sollte sie nennen, bevor jemand aufgrund des vorigen Abschnitts Hardware kauft. Ein Modell mit sechs Gigabyte fasst Dokumente zusammen, sortiert sie und beantwortet Fragen dazu. Das ist wirklich nützlich. Es verliert aber auch den Faden mitten in einer langen Kette von Werkzeugaufrufen, vergisst eine Anweisung, die zwanzig Schritte früher kam, und liefert eine selbstsichere Antwort dort, wo es hätte sagen müssen, dass es etwas nicht weiß. Genau daran entscheidet sich, ob ein Agent funktioniert. Wer ein kleines Modell unbeaufsichtigt einen Arbeitsablauf laufen lässt, bekommt einen Ablauf, der die ersten zehn Minuten zu funktionieren scheint.

Dieselbe Rechnung gilt auch in die andere Richtung, und das ist der wichtige Teil. Die Modelle, die gut genug sind, um einen Agenten zu betreiben, sind Modelle mit offenen Gewichten. Es gibt sie, man kann sie herunterladen, und sie sind der Grund, warum der Gast sagen kann, die meisten Nutzer könnten den größten Teil ihrer Arbeit mit offenen Modellen erledigen — die zuvor genannte Zahl von neunzig Prozent. An ihnen ist nichts verschlossen. Verschlossen ist nur die Maschine, die eines aufnehmen kann.

Der Agent im eigenen Haus, das Modell eine Schnittstellenabfrage entfernt.
Der Agent im eigenen Haus, das Modell eine Schnittstellenabfrage entfernt.

Die nützliche Aufteilung hat also nichts mit lokal gegen Cloud zu tun. Sie heißt: der Agent an einem Ort, die Intelligenz an einem anderen.

Und die zweite Hälfte dieser Aufteilung verdient einen klaren Satz, weil sie der Teil ist, den Menschen in beide Richtungen falsch verstehen. Kein normaler Mensch wird ein Spitzenmodell mit offenen Gewichten zu Hause betreiben.

Ein kleiner Heimrechner, und durch das Fenster die riesige verschwommene Silhouette eines Rechenzentrums.
Ein kleiner Heimrechner, und durch das Fenster die riesige verschwommene Silhouette eines Rechenzentrums.

Entschlossenheit hilft hier nicht, und eine bessere Karte auch nicht. So ein Modell zu betreiben, verlangt Speicher in der Größenordnung von Hunderten Gigabyte und Bandbreite in Terabyte pro Sekunde. Das ist eine Maschine in einem Gebäude mit ernsthafter Stromversorgung und ernsthafter Kühlung. Etwas anderes zu behaupten, kostet Menschen Geld.

Was ein normaler Mensch absolut tun kann: den Agenten und die Dateien auf eigener Hardware laufen lassen und ein Spitzenmodell mit offenen Gewichten auf einem gemieteten fremden Rechner erreichen. Das ist ein privater Server in dem Sinn, auf den es ankommt: der eigene, unter eigener Kontrolle, mit den eigenen Daten, der mit einem Modell spricht, statt das Geschäft auszuhändigen. Das ist etwas anderes, als dasselbe Material an ein geschlossenes Labor zu schicken, das damit trainiert und Anteilseignern verantwortlich ist, deren Interessen nicht die eigenen sind.

Ein beleuchtetes Haus am Stadtrand in der Nacht; aus einem Fenster strömt ein Schwall leuchtender Dokumente in den Himmel.
Ein beleuchtetes Haus am Stadtrand in der Nacht; aus einem Fenster strömt ein Schwall leuchtender Dokumente in den Himmel.

Setz den Agenten auf Hardware, die dir gehört. Dort sammelt sich der Wert: deine Dateien, das Gedächtnis, das er aufbaut, die Zeitpläne, die er abarbeitet, die Aufzeichnung dessen, was er für dich getan hat. Nichts davon braucht eine Grafikkarte, und alles davon ist es wert, behalten zu werden. Dann miete die Intelligenz, denn die Intelligenz ist der eine Baustein, der tatsächlich zur Handelsware geworden ist, tatsächlich austauschbar ist und sich tatsächlich alle paar Monate verbessert.

Diese Aufteilung hält auch aus der Falle heraus, vor der der Gast warnt. Die Gefahr ist die Bindung an einen einzigen Anbieter. Das Modell eines Anbieters in diesem Monat zu nutzen, weil es das stärkste oder das billigste ist, während die Dateien und der Agent die eigenen bleiben — das ist keine Bindung an irgendetwas. Die eigentliche Arbeit leistet das Gerüst, das diesen Wechsel erlaubt.

Was das ehrlich gerechnet kostet

Jetzt die Rechnung, mit der Korrektur, die sie verdient.

Eine Maschine, die man schon besitzt und einfach eingeschaltet lässt, verursacht für den Agenten selbst keine Nutzungsrechnung. Wer nie eine Grafikkarte kauft, dessen laufende Kosten sind der Strom.

Dateigröße gegen benötigten Speicher.
Dateigröße gegen benötigten Speicher.

Für die Modelle, die einen Agenten antreiben können, beantwortet sich die Hardware-Frage von selbst. Eine Datei mit fünfundsechzig Gigabyte passt nicht in eine Karte mit zwölf Gigabyte. Sie über den Arbeitsspeicher des Systems zu verteilen, bringt einen zurück in den Bereich von Sekunden pro Token. Die ehrliche Schlussfolgerung lautet: Spitzenmodelle mit offenen Gewichten gehören auf gemietete Maschinen — sei es ein Dienst mit Abrechnung nach Verbrauch oder eine Grafikkarte, die man stundenweise mietet.

Welche Modellgröße welche Hardware-Stufe bewältigt.
Welche Modellgröße welche Hardware-Stufe bewältigt.

Damit kommt der Text zu dem Dienst, den die meisten in diesem Umfeld ohnehin installiert haben. Ollama lässt Modelle auf eigener Hardware laufen und berechnet dafür nichts. Unter dem Namen Ollama Cloud bietet es zusätzlich gehostete Textgenerierung für Modelle mit offenen Gewichten an. Die Einstiegsstufe ist kostenlos, und die Cloud-Seite wird über Guthaben abgerechnet, das pro Token verbraucht wird, nicht über einen festen Platzpreis. Jenseits der kostenlosen Stufe nennen die veröffentlichten Tarife zwanzig Dollar im Monat und hundert Dollar im Monat. Lies sie auf der Preisseite selbst nach; sie wurden mehr als einmal umgebaut, und jede aus zweiter Hand zitierte Zahl veraltet schnell.

Preise je Million Token für vier offene Modelle: Eingabe gegen Ausgabe.
Preise je Million Token für vier offene Modelle: Eingabe gegen Ausgabe.

Zwischen dem billigsten und dem teuersten Modell in dieser Übersicht liegt der Faktor fünfzig. Diese eine Tatsache ist das gesamte wirtschaftliche Argument dieses Textes. Sie ist der Grund, warum der Gast etwas sagt, das ein Jahr zuvor absurd geklungen hätte: Die meisten Nutzer können den größten Teil ihrer Arbeit mit offenen Modellen erledigen. Er beziffert es auf neunzig Prozent der Nutzer, die neunzig Prozent ihrer Arbeit damit schaffen. Er nennt auch die ehrliche Ausnahme: Manche Arbeit verlangt wirklich das größte Modell. Und er hütet sich zu behaupten, die billigen Modelle gewönnen überall.

Aus der Übersicht folgt keine Anschaffung, sondern eine Gewohnheit: die Routinearbeit an das billige Modell schicken und das teure für die schwierigen zehn Prozent aufsparen. Diese Gewohnheit steht einem nur offen, wenn der eigene Aufbau die Modelle wechseln kann, ohne dass etwas neu gebaut werden muss.

Wer das eigentlich baut

Es lohnt sich zu wissen, wer hinter dem Gerüst in jenem Gespräch steht, denn das erklärt die Form der Sache.

Der Gast arbeitet in einem Forschungsinstitut, das noch klein ist und sich selbst so beschreibt. Davor war er in der Bitcoin-Branche tätig, an verteilten Systemen und dezentraler Rechenleistung — ein Hintergrund, der Aufmerksamkeit verdient. Einige der Menschen, die heute Infrastruktur für KI bauen, kommen aus dieser Welt. Sie brachten ein fertiges Argument mit: Ein Mensch sollte die Maschine besitzen können, die für ihn denkt, statt nur Zugang zu einer fremden zu mieten.

Das ist bei einem Institut wie diesem keine Werbeposition. Es ist der Grund, warum es das Gerüst in dieser Form gibt. Das Institut trainiert offene Modelle in einer zweiten Phase weiter und betreibt einen Agenten, den jeder installieren und auf jedes Modell richten kann — auch auf Modelle von Wettbewerbern. Es ist derselbe Hermes Agent, der im Gespräch am Anfang dieses Textes vorkam. Das eigene gehostete Angebot ist freiwillig, und wer es nie anfasst, gilt nicht als Fehlerfall. Das erklärte Ziel ist, Menschen dort abzuholen, wo sie stehen. Dass eine Firma das wörtlich meint, ist ungewöhnlich. Deshalb soll dasselbe Werkzeug für eine einzelne Person am Laptop funktionieren und für ein Unternehmen, das es auf vielen Rechnern betreibt.

Wo sich die Maschine bezahlt macht

Dann ist da die Frage, die alle wirklich stellen: Rechnet sich gekaufte Hardware besser als gemietete? Das ist Rechnen, also rechnen wir, statt ein Ergebnis zu behaupten.

Nehmen wir eine gebrauchte Karte mit vierundzwanzig Gigabyte plus Netzteil und Gehäuse für ungefähr siebenhundertfünfzig Dollar. So eine Karte zieht unter Last etwa zweihundertfünfzig Watt und im Leerlauf knapp zwanzig. Lässt man sie vier Stunden am Tag laufen und die übrige Zeit am Strom, verbraucht sie rund zweiundvierzig Kilowattstunden im Monat. Bei einem Haushaltspreis von etwa fünfunddreißig Cent sind das ungefähr zwölf Dollar Stromkosten im Monat. Vergleiche das mit den veröffentlichten Abo-Stufen: zwanzig Dollar im Monat in der unteren Stufe, hundert in der oberen.

Kumulierte Kosten über zehn Jahre: eigene Hardware gegen zwei Abo-Tarife.
Kumulierte Kosten über zehn Jahre: eigene Hardware gegen zwei Abo-Tarife.

Zwei Schnittpunkte, und sie sagen Unterschiedliches.

Gegenüber der Hundert-Dollar-Stufe hat sich die Maschine im neunten Monat bezahlt. Das ist keine knappe Sache. Innerhalb eines Jahres — danach gehört die Hardware einfach einem selbst.

Eine hohe, blasse Lichtsäule, von der leuchtende Fäden über eine dunkle Ebene laufen.
Eine hohe, blasse Lichtsäule, von der leuchtende Fäden über eine dunkle Ebene laufen.

Gegenüber der Zwanzig-Dollar-Stufe dreht sich die Rechnung vollständig um. Die Maschine erreicht diesen Punkt im vierundneunzigsten Monat, also nach fast acht Jahren. Wer behauptet, lokal gewinne immer, liest seine eigenen Zahlen nicht. Und das ist die ehrliche Antwort: Rein beim Preis schlägt ein Abo für zwanzig Dollar eine Grafikkarte deutlich, und wer Hardware kauft, um dieses Abo zu sparen, betreibt ein Hobby mit angehängter Tabellenkalkulation.

Der Vergleich ist aber nicht rein finanziell, und das übersieht die Tabellenkalkulation. Die Hardware kauft etwas, das das Abo nicht liefert: Die Anfrage verlässt nie den Raum, das Modell kann einem nicht unter den Füßen weg abgeschaltet werden, und der Preis kann sich nicht ändern, weil der Anbieter seine Meinung geändert hat. Ob das die Differenz wert ist, ist eine Frage des eigenen Urteils über die eigene Arbeit. Wichtig ist, dass es jetzt ein Urteil mit Zahlen sein kann statt ein Gefühl.

Ein riesiges, glattes, unbeschriftetes Steinrad mit einem einzigen Lichtbalken und einem leeren Stuhl.
Ein riesiges, glattes, unbeschriftetes Steinrad mit einem einzigen Lichtbalken und einem leeren Stuhl.

Was du an diesem Wochenende tun kannst

Alles bisher war Argument. Jetzt kommt der Teil, der Anleitung ist, und er ist bewusst klein gehalten. Denn der typische Fehlschlag in diesem Feld ist der Versuch, am ersten Tag einen Dom zu bauen.

Fang mit einer Aufgabe an, die du jede Woche erledigst. Etwas Langweiliges und Konkretes, kein Projekt und keine Umstellung: ein Ordner, den du durchliest, ein Bericht, den du zusammenstellst, eine Liste, die du von Hand pflegst. Schreib auf, wie „fertig“ dafür aussieht. Wenn du das Ergebnis nicht in einem Satz beschreiben kannst, ist die Aufgabe zu groß für einen ersten Versuch.

Setz den Agenten dorthin, wo er dir nicht schaden kann. Der Hermes Agent lässt sich mit einem einzigen Befehl unter Linux, macOS oder Windows installieren. Gib ihm einen Container (einen abgeschotteten Bereich), eine kleine virtuelle Maschine oder einen alten Laptop. Gib ihm Zugriff auf diesen einen Ordner und auf nichts sonst. Das ist keine Paranoia. Was es dir verschafft, ist die Ruhe, das Ding laufen zu lassen, während du etwas anderes tust — und genau darum geht es.

Verbinde ihn mit einem Modell, das du mietest, statt mit einem, das du selbst betreibst. Das ist der Schritt, den viele falsch machen, und darum ging es in der Preisübersicht oben. Melde dich bei einem Dienst für offene Modelle an, nimm die kostenlose Stufe und füge den Zugangsschlüssel in die Konfiguration deines Agenten ein. Jetzt läuft ein Agent auf deiner Maschine und spricht mit einem Modell, das auf gemieteter Hardware liegt. Zwei Dateien geändert. Das ist der ganze Aufbau.

Dann lass ihn auf die Aufgabe los und lies, was er produziert. Lies die tatsächliche Ausgabe, nicht die Zusammenfassung, die er dir reicht. Der erste Durchlauf wird irgendwo falsch sein, und wo er falsch ist, zeigt dir, was du nicht festgelegt hast. Diese Lücke zwischen dem, was du verlangt hast, und dem, was du gemeint hast, ist die eigentliche Arbeit, und sie verschwindet nicht mit einem größeren Modell.

Behalte, was er gelernt hat. Jeder ernsthafte Agent schreibt auf, wie er etwas gelöst hat, damit er es nicht zweimal lösen muss. Gib deinem einen Ort, an dem er das ablegen kann, und lies gelegentlich hinein. Der Zuwachs in diesen Systemen entsteht nicht dadurch, dass das Modell über Nacht klüger wird. Er entsteht dadurch, dass eine Lösung einmal aufgeschrieben und nie wieder neu gesucht wird. Das ist der Unterschied zwischen einem Werkzeug, das man benutzt, und einem System, das sich etwas aufbaut.

Erst dann denk über Hardware nach. Lass die Sache zuerst einen Monat laufen. Wenn die einzige Grenze, an die du stößt, die Rechnung ist und du einen übrigen Rechner hast, dann ist eine Grafikkarte für die kleinen Routineaufgaben eine Überlegung wert. Wenn du an diese Grenze nicht gestoßen bist, brauchst du sie noch nicht. Und die Karte, die du heute kaufst, wird teurer und schlechter sein als die, die du in einem Jahr kaufst.

Nichts auf dieser Liste verlangt ein Rechenzentrum, Verhandlungen über ein Abo oder die Erlaubnis von jemandem. Ein Nachmittag und eine langweilige Aufgabe sind alles, was nötig ist.

Hände legen leere Karteikarten in sorgfältiger Ordnung auf eine Werkbank unter einer einzigen Lampe.
Hände legen leere Karteikarten in sorgfältiger Ordnung auf eine Werkbank unter einer einzigen Lampe.

Der Teil, den ich nicht überverkaufe

Drei ehrliche Grenzen, denn das Feld ist voll von Leuten, die sie weglassen.

Erstens: Ein lokales Modell ist kein Spitzenmodell. Bei wirklich schwierigem Schlussfolgern verliert es, und wer etwas anderes behauptet, sorgt dafür, dass Menschen enttäuscht werden und nach einem Monat wieder bei den geschlossenen Diensten landen.

Ein kleiner warmer Heimrechner am Fuß einer gigantischen dunklen Maschine.
Ein kleiner warmer Heimrechner am Fuß einer gigantischen dunklen Maschine.

Der richtige Rahmen ist eine Arbeitsteilung, kein Ersatz.

Zweitens: „Offene Gewichte“ heißt nicht automatisch „privat“. Offen beschreibt die Lizenz und sagt nichts über den Betrieb. Wer offene Gewichte auf fremden Servern laufen lässt, bekommt den Vorteil der Lizenz und keinen einzigen Vorteil beim Datenschutz. Der Gast in jenem Gespräch benennt diese Falle ausdrücklich. Ein offenes Modell sagt nichts darüber, wer die Maschine in der Hand hat, auf der es läuft. Schau nach, wo die Rechenleistung steht; die Lizenz allein verrät sehr wenig.

Drittens: Das ist nicht wartungsfrei. Eine Maschine im eigenen Zimmer braucht Aktualisierungen und gelegentlich auch einen Sonntag, an dem man sie repariert. Ein Abo braucht das nicht. Diese Zeit ist real und gehört in die Rechnung. Genau deshalb sollte man die Zahl von acht Jahren oben als Warnung lesen und nicht als Triumph.

Eine Glaskugel mit leuchtenden Teilchen, gehalten in einem zarten Käfig aus goldenem Licht.
Eine Glaskugel mit leuchtenden Teilchen, gehalten in einem zarten Käfig aus goldenem Licht.

Die Aufteilung, die funktioniert

Ein weiterer Punkt aus jenem Gespräch ist es wert, mitgenommen zu werden. Er beantwortet die naheliegende Frage, warum jemand in einem Forschungsinstitut möchte, dass die Gewichte offen bleiben.

Die Position des Gastes: Wenn man wirklich glaubte, diese Technologie könne katastrophal schiefgehen, dann wäre die Konzentration der Rechenleistung bei zwei oder drei Firmen die alarmierende Tatsache — nicht die Existenz frei herunterladbarer Modelle. Sein Argument ist knapp: Ein Modell, das von einem anderen Modell abgeleitet ist, kann das Modell, von dem es stammt, nicht übertreffen; offene Modelle können also nicht die Spitze sein. Dann sagt er, was viele denken und wenige öffentlich sagen: Das lauteste Argument gegen offene Gewichte kommt von den Parteien mit dem stärksten wirtschaftlichen Interesse an einer geschlossenen Tür.

Man muss diese Deutung nicht übernehmen. Die praktische Schlussfolgerung darunter ist die, um die dieser Text kreist, und nach allem oben lässt sie sich genau benennen. Modelle werden zur Handelsware — deshalb ist es vernünftig, sie zu mieten. Das Gerüst wird zur Handelsware — deshalb sollte man dafür keinen Aufpreis zahlen. Keine Handelsware ist der Stapel eigener Arbeit, den man für eine Maschine lesbar gemacht hat. Und dieser Teil wächst nur dort, wo man ihn aufbewahrt.

Dieser Bestand ist jedes Jahr mehr wert. Er ist der eine Teil des Ganzen, den einem niemand vermieten kann, und der einzige, der nur entsteht, wenn man anfängt.

Kauf also die Maschine, die den Agenten laufen lässt, nicht die, die das Modell sein will. Behalte die Dateien. Miete die Intelligenz bei einem Dienst für offene Modelle, und ändere deine Meinung darüber, welches Modell du mietest, sobald ein besseres oder ein billigeres auftaucht.

Für diese Aufteilung lohnt es sich zu streiten. Nicht weil sie rein wäre, und nicht weil sie ohne Kompromiss auskäme. Sondern weil dies die Fassung der Technologie ist, die ein normaler Mensch heute übernehmen kann, auf Hardware, die er schon besitzt, ohne sein Arbeitsleben an eine Firma auszuhändigen, der er nie begegnen wird. Sie kostet weniger, als die meisten annehmen. Sie ist jetzt verfügbar. Und sie lässt einem den Teil in der Hand, auf den es ankommt: alles, was man aufgeschrieben hat.

Die Tür steht gerade offen. Das ist ein guter Grund, hindurchzugehen, solange es noch stimmt.