Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenConversational AIKapitel 06von 12 im Pfad

Tools anbinden

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Ein Sprachagent, der etwas auslöst, ruft dafür ein Tool auf. Die Mechanik dahinter steht in Agenten und Harness, Kapitel 02 und Grundkurs, Kapitel 09. Hier geht es um die eine Sekunde, in der niemand etwas sagt.

Der Aufruf hält das Gespräch an

In der Voreinstellung gehört das zur Bauart. Die Dokumentation von Google sagt es für die Sprachschnittstelle ausdrücklich:

Function calling executes sequentially by default, meaning execution pauses until the results of each function call are available. (externe Seite, ai.google.dev)

Bei OpenAI steht dieselbe Reihenfolge in der Beschreibung des Ablaufs. Das Modell legt die Argumente in den Gesprächsverlauf, und dann:

When the client detects conversation items that contain function call arguments, it will execute custom code using those arguments (externe Seite, developers.openai.com)

Danach schickt die Anwendung das Ergebnis zurück und bittet um eine Antwort. Alles daran geht der Reihe nach.

Im Chatfenster ist das unauffällig. Wer eine Buchung anstößt, sieht einen Ladebalken. Im Gespräch entsteht an derselben Stelle Stille, und je nachdem, was das Tool tut, dauert sie eine halbe Sekunde oder zehn.

Die Ansage davor

Der einfachste Griff ist, die Wartezeit anzukündigen. Der Hersteller führt das als eigenes Bauteil und nennt es Preamble, also Vorspann. Beide Seiten davon stehen in einem Satz:

Used well, they reassure the user that the assistant is working. Used poorly, they become filler and increase perceived latency. (externe Seite, developers.openai.com)

Der zweite Satz ist der wichtigere. Eine Ansage, die nichts sagt, macht das Warten länger, weil sie es benennt, ohne es zu verkürzen. Die Dokumentation wird deshalb konkret. Angesagt wird, wenn

you are about to call a tool that may take noticeable time (externe Seite, developers.openai.com),

wenn Unterlagen geprüft werden, oder wenn eine Übergabe ansteht. Weggelassen wird die Ansage, wenn die Antwort ohnehin sofort kommt, wenn jemand nur bestätigt oder widerspricht, und wenn der Aufruf schnell ist.

Auch die Formulierungen stehen dort. Zu vermeiden sind „Let me think…“ und „One moment while I process that…“. Empfohlen sind Sätze, die die Handlung nennen: „I’ll check that order now.“ Der Unterschied liegt im Bezug. Das eine beschreibt den Zustand der Maschine, das andere die Sache, um die es geht.

Was sich dadurch nicht ändert

Die Kosten aus Agenten und Harness, Kapitel 02 gelten weiter. Im Normalfall steht jede Tool-Beschreibung in jeder Anfrage im Kontextfenster, und fünf Server mit je acht Tools sind vierzig Beschreibungen. Am Sprachkanal ändert das nichts. Was dazukommt, ist eine zweite Rechnung in einer zweiten Währung.

Quellen

5 Einträgealle erreichbar

Erreichbarkeit automatisch geprüft

  • Dokumentationerreichbar

    Google, Tool use with Live API (externe Seite, ai.google.dev)

    ai.google.devgeprüft 24.09.2026

    Die Doku zum Tool Call in einer laufenden Sprachsitzung, und der einzige Ort im Bestand, an dem ein Anbieter die Voreinstellung ausspricht: Der Aufruf läuft der Reihe nach, und die Verarbeitung hält an, bis das Ergebnis da ist. Es gibt eine Einstellung dagegen, und dieselbe Seite vermerkt unter ihr, dass das neueste Live-Modell sie nicht beherrscht.

  • Dokumentationerreichbar

    OpenAI, Realtime conversations (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Die Beschreibung dessen, was in einer laufenden Sprachsitzung passiert, und der Ort, an dem der Anbieter den Preis einer Prüfung vor der Antwort selbst benennt: Wer die automatische Antwort abschaltet, um Eingaben zu moderieren, zu prüfen oder erst etwas nachzuschlagen, bezahlt das mit Wartezeit. Dieselbe Seite nennt die Obergrenze einer Sitzung und beschreibt den Ablauf eines Tool Calls.

  • Dokumentationerreichbar

    OpenAI, Using realtime models (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Die Anleitung zum Anweisen eines Sprachmodells, das rohen Ton verarbeitet. Sie belegt nebenbei, was ein solches Modell auseinanderhalten kann: Stille, Hintergrundgeräusch, Wartemusik, Fernsehton und ein Gespräch, das jemand anderem gilt. Dieselbe Seite führt die Ansage vor einer Wartezeit als eigenes Bauteil mit Namen und benennt ihre Kehrseite: Schlecht gemacht erhöht sie die gefühlte Wartezeit. Die Anweisungen stehen dort für zwei Modellfassungen nebeneinander und lauten verschieden; zitiert ist hier die neuere.

  • Artikelerreichbar

    Simon Willison, GPT-5.5 prompting guide (externe Seite, simonwillison.net)

    simonwillison.netgeprüft 24.09.2026

    Datiert den Erscheinungstag des GPT-5.5-Leitfadens auf den 25.04.2026 und zitiert die Kernsätze wörtlich. Wird hier nur als Datumsbeleg geführt: Die Herstellerseite selbst nennt keinen Zeitpunkt, an dem sie geschrieben wurde.

  • Dokumentationerreichbar

    Model Context Protocol, Spezifikation (externe Seite, modelcontextprotocol.io)

    modelcontextprotocol.iogeprüft 24.09.2026

    Die jeweils maßgebliche Fassung des Standards, über den ein Sprachmodell an fremde Tools und Datenquellen kommt. Die Adresse leitet auf die aktuelle Fassung weiter, seit dem 28.07.2026 auf 2026-07-28.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.