Künstliche Intelligenz

Inferenz

Die Nutzung eines fertigen Modells für eine einzelne Anfrage – jede Antwort kostet erneut Rechenleistung.

Einfach erklärt

Inferenz ist der laufende Betrieb, also die Berechnung von Ausgaben mit einem trainierten Modell. Jede Frage, jede Bildgenerierung, jede Zusammenfassung löst erneut Rechenarbeit aus und damit Stromverbrauch und Kosten. Längere Eingaben und Antworten, größere Modelle und Bilder kosten mehr als eine kurze Textfrage.

Das erklärt viele Produktentscheidungen: kostenlose Nutzung wird begrenzt, Pro-Versionen haben Kontingente, Geschäftskunden zahlen nach Tokens. Kürzere Prompts, ein kleineres Modell für einfache Aufgaben und das Wiederverwenden von Ergebnissen senken die Kosten spürbar.

Beispiel aus dem Alltag

„Was ist die Hauptstadt von Peru?" ist für den Anbieter fast gratis. „Fasse diese 80 Seiten zusammen" kostet ihn merklich Rechenzeit.

Häufige Fragen

  • Warum sind Gratis-Angebote oft begrenzt?

    Weil jede Nutzung den Anbieter Rechenzeit kostet. Grenzen, Wartezeiten oder kleinere Modelle in der Gratisstufe senken diese Kosten.

Wie aus Übungen ein fortlaufendes Training wird: medienkundigs Lernzyklus kennenlernen.