Die Kurzfassung
Klassische Marketing-Automation führt einen Workflow aus, den Sie gezeichnet haben: wenn dies, dann das. Agentische Software bekommt stattdessen ein Ergebnis vorgegeben – den Churn in Woche vier senken, den Trial-Funnel füllen – und erarbeitet die Schritte selbst: Sie ruft dabei Tools auf, liest, was passiert ist, und korrigiert sich. Auf genau diese Schleife zielt das Adjektiv agentisch. Anbieter verkaufen dieselbe Idee auch als autonomes Marketing.
Was das Wort nicht verrät, ist, wie lang die Leine der Software ist. Ein System kann fünf Schritte planen und trotzdem für Ihre Freigabe anhalten, bevor es irgendetwas verschickt. Diese Unterscheidung geht in den meisten Beschreibungen der Kategorie verloren, und sie entscheidet, ob ein Tool sicher genug ist, um es auf Ihre Kundschaft loszulassen.
Keine neutrale Instanz hat ihn definiert
Es gibt keine Referenzdefinition für Agentic Marketing. Wikipedia hat keinen Artikel zu dem Begriff. Kein Normungsgremium hat ihn definiert. Die kursierenden Definitionen stammen fast alle von Unternehmen, die genau die Software verkaufen, die sie definieren – Salesforce, Adobe, Braze und HubSpot veröffentlichen je eine, und in diesem Absatz tun wir es auch. Das sollte man offen sagen, statt so zu tun, als wäre es anders.
Die beiden Analysten-Definitionen, an denen man sich orientieren sollte, sind enger als die der Anbieter. Gartner beschreibt agentische KI als Systeme, die autonom planen und Aktionen ausführen, um von Nutzern festgelegte Ziele zu erreichen. Die Definition von Forrester ist strenger und nützlicher, weil sie mit dem Zusatz endet, den alle anderen weglassen: Software, die flexibel planen und sich anpassen kann, um Ziele durch Handeln in ihrer Umgebung zu erreichen, mit zunehmenden Autonomiestufen. Zunehmende Stufen. Kein Schalter.
Die Autonomie-Leiter
Die Analysten-Definitionen sind sich einig, dass die Software planen und handeln muss, also reicht das Etikett nur bis zu den obersten zwei Stufen dieser Leiter. Offen lassen sie den Schritt, der in der Praxis am meisten zählt – ob das Ding für Sie anhält. Diese fünf Stufen ordnen Produkte danach, wie viel ohne Sie entschieden wird: Regeln, generative Unterstützung, Copilot, Agent mit Freigabe und unbeaufsichtigt.
Die Stufen eins und zwei entscheiden zur Laufzeit nichts. Stufe drei schlussfolgert, handelt aber nicht – dieselbe Grenze zieht auch unser Leitfaden zu Agenten und Chatbots. Nur die Stufen vier und fünf planen und handeln zugleich, und alles darunter in der Sprache der oberen Stufen zu beschreiben, nannte Gartner Agent Washing: das Umetikettieren bestehender Produkte wie KI-Assistenten, Robotic Process Automation und Chatbots ohne nennenswerte agentische Fähigkeiten. In derselben Mitteilung vom Juni 2025 schätzte Gartner, dass nur etwa 130 der Tausenden Anbieter, die das Etikett beanspruchen, es zu Recht tun, und sagte voraus, dass bis Ende 2027 mehr als 40 % der Projekte mit agentischer KI eingestellt werden – eine Prognose für 2027, keine gemessene Ausfallquote.
Die Stufen vier und fünf sind dieselbe Software mit verschobenem Kontrollpunkt. Der Schritt zwischen ihnen ist deshalb eine Betriebsentscheidung, keine Kaufentscheidung – und diese Wahl gehört zum Thema Human-in-the-Loop-Marketing. Die Leiter misst außerdem nur Unabhängigkeit, nicht den Schadensradius: Ein einzelnes In-App-Banner automatisch auszuspielen und automatisch einen Versand an Ihre ganze Liste zu schicken, stehen auf derselben Stufe und bergen bei Weitem nicht dasselbe Risiko. Der Umfang ist der zweite Regler, und bei ihm sollten Sie am strengsten sein.
Warum die oberste Stufe selten ist
Lange autonome Ketten scheinen auf eine bestimmte Weise zu scheitern: Die Fehlerquote potenziert sich mit jedem Schritt. Toby Ord hat ein Modell an die Research-Engineering-Aufgaben von METR angepasst und festgestellt, dass sich die Daten mit einer ungefähr konstanten Wahrscheinlichkeit erklären lassen, mit der ein Agent pro Minute gleichwertiger menschlicher Arbeit scheitert – woraus eine exponentiell sinkende Erfolgsquote folgt, je länger die Aufgaben werden. Jedes System hat damit faktisch eine Halbwertszeit. Ord betont ausdrücklich, dass noch offen ist, ob das auch für andere Aufgabensammlungen gilt – aber das Muster passt zu dem, was Praktiker berichten: Kurze Aufgaben gelingen, lange unbeaufsichtigte zerfallen.
Konsistenz ist das schwierigere Problem. Der Benchmark tau-bench, 2024 von Sierra veröffentlicht, maß nicht nur, ob ein Agent eine Aufgabe erledigte, sondern ob er das wiederholt schaffte: Die führenden Modelle dieser Generation bestanden weniger als die Hälfte der Aufgaben und lösten im Einzelhandelsbereich dieselbe Aufgabe in weniger als einem Viertel der Fälle bei allen acht Versuchen. Die Modelle sind seitdem besser geworden, doch entscheidend ist das Muster des Befunds: Selbst einen hypothetischen Agenten, der in vier von fünf Fällen funktioniert, lassen Sie nicht allein mit Ihrer Liste.
Schlimmer noch: Fehler sind nicht immer sichtbar. Eine Studie aus dem Jahr 2026 zu Agentenverläufen fand, dass ein großer Teil der Fehler still blieb: Der Agent meldete die Aufgabe als erledigt, während die Umgebung etwas anderes zeigte – in den Single-Control-Bereichen eines Benchmarks bei 45 bis 48 % der Fehler. Dieselbe Studie fand 3 % in einem Dual-Control-Bereich; die Quote hängt also stark vom Aufbau ab. Doch stilles Scheitern ist bei jeder dieser Quoten ein Argument für einen Freigabeschritt und ein Entscheidungsprotokoll, nicht nur für bessere Modelle.
Dazu kommt ein Sicherheitsmuster, das speziell das Marketing betrifft. Simon Willisons Lethal Trifecta beschreibt die Gefahr, Zugriff auf private Daten, den Kontakt mit nicht vertrauenswürdigen Inhalten und die Fähigkeit zur Kommunikation nach außen zu kombinieren – und eine Marketing-Plattform vereint alle drei konstruktionsbedingt: Ihre Kundenliste, eingehende Antworten, die Sie nicht geschrieben haben, und einen Senden-Button. Diese Kombination verdient schon für sich genommen einen Kontrollpunkt.
Wie Sie ein Versprechen prüfen
Mit einer Handvoll Fragen können Sie jedes Produkt auf der Leiter einordnen. Die Antworten stehen meist eher in der Dokumentation als auf der Landingpage.
| Frage | Wie eine substanzielle Antwort klingt |
|---|---|
| Was erstellt es ohne mich? | Benannte Objekte in der Plattform – ein Segment, eine Journey, ein Test –, kein Entwurf in einem Chatfenster. |
| Wo ist der Kontrollpunkt, und kann ich ihn verschieben? | Die Freigabe ist pro Fläche konfigurierbar und standardmäßig aktiv. |
| Was passiert, wenn ein Schritt fehlschlägt? | Es hält an und sagt es. Wenn es Ihnen nicht sagen kann, was fehlgeschlagen ist, kann man ihm keinen unbeaufsichtigten Betrieb anvertrauen. |
| Kann ich sehen, warum es so entschieden hat? | Ein Entscheidungsprotokoll mit der Begründung, nicht nur ein Zeitstempel und ein Status. |
| Was kostet ein Durchlauf? | Eine echte Zahl. Mehrstufige Agenten rufen Modelle immer wieder auf; die Kosten pro Ergebnis sind eine Design-Vorgabe, keine Fußnote. |
Jetzt der unangenehme Teil, denn diese Seite stammt von einem Anbieter, und den Test oben haben wir geschrieben, die Leiter ebenso. Beim Veröffentlichen steht die KI von fromHello auf Stufe vier. Über den MCP-Server erstellt der KI-Client, den Sie bereits nutzen, echte Objekte (Segmente, Vorlagen, Journey-Entwürfe), und der integrierte Assistent tut dasselbe aus einem Satz; eine Journey bleibt ein Entwurf, bis sie veröffentlicht wird, und Veröffentlichen, Pausieren oder Löschen erfordert einen Bestätigungsschritt, der über MCP in Ihrem KI-Client stattfindet, nach dessen eigenen Berechtigungseinstellungen. Kein KI-Tool verschickt eine Nachricht. Unterhalb dieser Linie arbeitet sie näher an Stufe fünf: Änderungen an einem Segment oder einer Vorlage gelten beim Speichern und erreichen die nächsten Versände einer laufenden Journey, und die Personalisierung zum Versandzeitpunkt schreibt, sobald Sie sie für einen E-Mail-Schritt einschalten, jede Nachricht ohne Einzelprüfung um; fällt die KI aus, wartet der Versand standardmäßig. Der Kontrollpunkt ist vom Produkt festgelegt und nicht pro Fläche verschiebbar, und das Audit-Log protokolliert MCP-Tool-Aufrufe, nicht die Überlegungen des Modells; das Warum bleibt im Gespräch mit Ihrer KI. MCP-Aufrufe werden nie nach Verbrauch abgerechnet; in der fromHello Cloud läuft der integrierte Assistent mit den KI-Credits, die ab dem Tarif Team enthalten sind. Wir haben den Test geschrieben, also gewichten Sie unsere Bewertung geringer.
Zwei weitere Dinge sind inzwischen Pflicht, nicht Kür. Offenlegung ist in der EU bereits Gesetz: Die Transparenzpflichten nach Artikel 50 der KI-Verordnung (AI Act), nach denen Menschen erfahren müssen, wenn sie mit einem KI-System interagieren, gelten seit dem 2. August 2026 und sind nicht auf Hochrisikosysteme beschränkt. Und die Verantwortung geht nicht auf die Software über: Im Fall Moffatt v. Air Canada machte das Civil Resolution Tribunal von British Columbia die Fluggesellschaft für falsche Auskünfte haftbar, die ihr eigener Chatbot einem Passagier gegeben hatte, und wies das Argument zurück, der Chatbot sei eine eigenständige Einheit, die für sich selbst verantwortlich sei. Beides trifft Sie als Betreiber, nicht den Anbieter, den Sie gerade prüfen.
Was das für ein kleines Team bedeutet
Was über die Kategorie geschrieben wird, richtet sich an Großunternehmen, und die Umfragedaten dahinter tun es auch: Der CMO Spend Survey 2026 von Gartner stützte sich auf 401 Marketingverantwortliche, die große Mehrheit davon in Unternehmen mit mehr als einer Milliarde Dollar Umsatz. Auch die tatsächliche Verbreitung hinkt dem Hype hinterher, wobei sich die gemessene Zahl auf Technologieverantwortliche bezieht, nicht auf Marketer: Der 2026 Gartner CIO and Technology Executive Survey bezifferte den Einsatz von KI-Agenten auf 17 % der Organisationen, während mehr als 60 % damit rechnen, sie innerhalb von zwei Jahren einzusetzen.
Für ein Unternehmen mit zwei Personen fällt die praktische Lesart enger und ermutigender aus. Sie brauchen nicht die Kategorie; Sie brauchen konkrete Arbeit, die erledigt wird – die Onboarding-Sequenz geschrieben, die Churn-Kohorte gefunden. Software auf Stufe vier bereitet diese Arbeit vor, und eine Journey, die sie baut, bleibt ein Entwurf, bis sie veröffentlicht wird; prüfen Sie, welche ihrer anderen Änderungen schon beim Speichern wirksam werden. Einen eigenen Leitfaden gibt es zu der Frage, was Sie an KI abgeben und was Sie behalten; wie Agenten auf geplanter und ausgelöster Automation aufsetzen, steht in Autonomes Marketing erklärt; und den Unterschied zwischen einem Agenten und dem Chatbot, mit dem er oft verwechselt wird, erklärt KI-Marketing-Agenten vs. Chatbots.