Zum Hauptinhalt springen
Bibha Startseite

Forschungsüberblick,

TimesFM-3: multivariate Zeitreihenprognose im Zero-Shot-Modus in einem Durchgang

TimesFM-3 ist die neueste Version des Zeitreihen-Foundation-Models von Google Research und die erste der Modellfamilie, die nativ für multivariate Zeitreihenprognose vortrainiert wurde. Es sagt mehrere zusammenhängende Reihen zugleich vorher, nutzt vergangene und bekannte künftige Kovariaten und liefert den gesamten Horizont in einem Vorwärtsdurchlauf, ohne aufgabenspezifisches Fine-Tuning.

Von Pupinder Singh, Mitgründer & CTO, Bibha AI Labs

Warm getönte Bänder, die nebeneinander fließen, durch leuchtende Fäden verbunden sind und sich rechts zu durchscheinenden grünen Bahnen auffächern
KI-generierte Illustration: zusammenhängende Reihen, die sich gemeinsam bewegen und dann zu einer Bandbreite möglicher Zukunftsverläufe öffnen.

Was ist TimesFM-3?

TimesFM-3 ist ein Zeitreihen-Foundation-Model von Google Research für Zero-Shot-Einsatz und multivariate Zeitreihenprognose: Es sagt mehrere zusammenhängende Reihen zugleich voraus, auch auf Datensätzen, auf denen es nie trainiert wurde. Ayush Jain und Rajat Sen stellten es am 31. August 2026 vor; der Beitrag nennt Yichen Zhou, Petros Mol, Abhimanyu Das und Samet Oymak als Mitwirkende.

Die Modellfamilie begann 2024 mit TimesFM, das ein Artikel auf der ICML 2024 als Patch-basiertes, decoderartiges Attention-Modell beschreibt, vortrainiert auf einem großen Zeitreihenkorpus. Die Versionen bis TimesFM-2.5, veröffentlicht im September 2025, prognostizieren jede Reihe aus ihrer eigenen Historie. Laut Repository erhielt 2.5 später über eine Erweiterung namens XReg wieder Unterstützung für Kovariaten, das Modell selbst blieb aber univariat.

TimesFM-3 hat 330 Millionen Parameter und wurde auf realen und synthetischen Daten mit insgesamt mehr als 1 Billion Zeitpunkten vortrainiert. Die Modellkarte nennt die Quellen: die Vortrainingssammlung von GIFT-Eval ohne Datensätze, die sich mit fev-bench überschneiden, Wikipedia-Seitenaufrufe bis November 2023, häufige Google-Trends-Suchanfragen bis Ende 2022 sowie synthetische und augmentierte Reihen.

Warum ist multivariate Zeitreihenprognose wichtig?

Die meisten Geschäftsprognosen hängen von mehr als einer Reihe ab. Die Nachfrage nach einem Produkt bewegt sich mit verwandten Produkten, mit der Kundenfrequenz und mit bereits geplanten Ereignissen; ein Modell, das nur eine einzige Historie sieht, lässt nützliche Signale ungenutzt. Multivariate Zeitreihenprognose erlaubt es einem Modell, diese Zusammenhänge zu lernen und in die Vorhersage zu übertragen.

Der Beitrag von Google veranschaulicht das am Eisverkauf einer Handelskette. Die Historie allein verfehlt die Treiber: Waffel- und Sirupverkäufe bewegen sich mit dem Hauptprodukt, die Besucherzahlen schwanken mit der Saison, und Aktionen, Feiertage und Wettervorhersagen sind im Voraus bekannt.

TimesFM-3 verarbeitet drei Eingaberollen ohne aufgabenspezifische Anpassung.

  • Mehrere Zielreihen. Mehrere verwandte Reihen, etwa konkurrierende Eismarken, werden gemeinsam prognostiziert, jeweils mit Punktprognose und Quantilen.
  • Vergangene Kovariaten. Signale, die nur bis zur Gegenwart beobachtet werden, etwa die bisherige Kundenfrequenz, fließen in die Prognose ein, ohne dass künftige Werte nötig sind.
  • Vergangene und künftige Kovariaten. Im Voraus bekannte Signale, etwa ein Aktionskalender oder eine Wettervorhersage, steuern den vorhergesagten Horizont direkt.

Wie funktioniert TimesFM-3?

TimesFM-3 behält den Decoder-only-Transformer früherer Versionen bei und ergänzt eine zweite Richtung der Aufmerksamkeit. Jede Reihe wird in Patches von 32 Zeitschritten zerlegt und auf ihrer eigenen Skala normiert; die Patches werden zu Tokens auf einem Raster aus Reihen und Zeit, und die Aufmerksamkeit wechselt zwischen beiden Achsen.

Tokens von Zielreihen und vergangenen Kovariaten enthalten je einen Patch. Tokens von vergangenen und künftigen Kovariaten hängen zusätzlich die kommenden Patches an, ein Vorgriff, mit dem das Modell bekannte Zukunftswerte früh lesen kann. Nach einem Eingangs-Residualblock durchlaufen die Tokens einen Stapel, der die beiden Aufmerksamkeitsarten über mehrere Schichten abwechselt. Die Modellkarte nennt 20 Transformer-Schichten, eine Modellbreite von 1280 und 16 Attention-Köpfe.

  • Kausale zeitliche Aufmerksamkeit. Innerhalb einer Reihe beachtet jedes Token nur frühere Tokens, sodass das Modell die Zukunft der vorhergesagten Reihe nicht sehen kann.
  • Volle Aufmerksamkeit über Variablen. Zu jedem Zeitschritt beachtet ein Token alle anderen Reihen der Eingabe. So kann das Modell reihenübergreifende Effekte lernen, etwa wie eine Aktion in einer Reihe den Absatz in einer anderen steigert.

Den gesamten Horizont in einem Durchgang prognostizieren

Frühere TimesFM-Versionen erzeugten Prognosen Patch für Patch und speisten jede Ausgabe wieder als Eingabe ein, eine Schleife, die Latenz und Rechenaufwand erhöht und Fehler aufschaukeln lässt. TimesFM-3 füllt den gesamten Horizont in einem einzigen Vorwärtsdurchlauf mit Contiguous Patch Masking, einer Maskierungsstrategie für das Training, die mit dem Prognosemodell TiRex eingeführt wurde.

Praktisch hängt das Modell für jeden künftigen Patch maskierte Platzhalter-Tokens an. Zielreihen und vergangene Kovariaten bleiben im Horizont maskiert, weil ihre Zukunft unbekannt ist, während vergangene und künftige Kovariaten sichtbar bleiben. Die abwechselnden Aufmerksamkeitsschichten füllen dann alle maskierten Patches auf einmal, ganz ohne iterative Schleife.

Für jede Zielreihe liefert das Modell 9 Quantile, vom 10. bis zum 90. Perzentil, für jeden Schritt des Horizonts und damit einen direkten Blick auf die Prognoseunsicherheit. Die Modellkarte nennt eine Patch-Länge von 32 für den Kontext und von 64 für den Prognosehorizont.

Der Beitrag von Google zeigt den Effekt an einem geplanten Aktionskalender, der als vergangene und künftige Kovariate übergeben wird. Eine univariate Prognose wiederholt das Wochenmuster und übersieht die Aktionen, während die multivariate Prognose den Absatzschub aus der Historie lernt und an jedem Aktionstag ein Plus von etwa 20 % erwartet. Der Beitrag stellt dies als Veranschaulichung dar, nicht als Benchmark-Ergebnis.

Wie schneidet TimesFM-3 in Prognose-Benchmarks ab?

Die Autoren berichten, dass TimesFM-3 auf allen drei verwendeten öffentlichen Benchmarks, GIFT-Eval, fev-bench und TIME, das bestplatzierte vortrainierte Foundation Model ist, sowohl bei der Punktgenauigkeit als auch bei der Qualität probabilistischer Prognosen. Die Ergebnisse sind als Durchschnittsrang über Aufgaben angegeben; die Aussage betrifft also die Reihenfolge, nicht die Größe der Fehler.

Der Vergleich umfasst aktuelle Foundation Models mit multivariater Unterstützung, darunter Chronos-2 und Modelle der Familie Toto 2.0, sowie das frühere TimesFM-2.5. Jedes Benchmark-Diagramm zeigt TimesFM-3 zweimal. Im univariaten Modus, in dem jede Zielreihe einzeln und ohne Kovariaten prognostiziert wird, erreicht oder übertrifft es die anderen Modelle bereits; mit eingeschalteten Kovariaten und reihenübergreifenden Informationen liegt es im Mittel bei Punktmetriken und probabilistischen Metriken gleichermaßen vorn.

Die Versionshinweise im Repository werden konkreter: Platz eins insgesamt auf fev-bench über 100 reale Aufgaben, Platz eins insgesamt auf TIME über 50 Datensätze und 98 Aufgaben und Platz eins unter den Foundation Models auf GIFT-Eval. Die drei Benchmarks prüfen Unterschiedliches.

  • Benchmark GIFT-Eval. Von Aksu und Kollegen 2024 vorgestellt, umfasst es 23 Datensätze mit über 144.000 Reihen und 177 Millionen Datenpunkten aus sieben Domänen und 10 Frequenzen, dazu einen separaten Vortrainingsdatensatz, der Datenlecks vermeiden soll.
  • Benchmark fev-bench. Von Shchur und Kollegen 2025 vorgestellt, enthält es 100 Prognoseaufgaben aus sieben Domänen, 46 davon mit Kovariaten, und berichtet Gewinnraten und Skill Scores mit Bootstrap-Konfidenzintervallen.
  • Benchmark TIME. Für die ICML 2026 angenommen, bietet es 50 neue Datensätze und 98 Aufgaben für strikte Zero-Shot-Evaluation, zusammengestellt in einem Prozess mit menschlicher Prüfung, der die Datenqualität sichern soll.

Welche Grenzen und offenen Fragen gibt es?

Die größte offene Frage ist die unabhängige Überprüfung. Zum Zeitpunkt der Recherche fanden wir keinen technischen Bericht und keinen Fachartikel zu TimesFM-3. Architektur und Ergebnisse stammen daher aus dem Ankündigungsbeitrag, der Modellkarte und dem Code-Repository, und die Benchmark-Aussagen beruhen auf Durchschnittsrängen, die die Autoren selbst berichten.

Unsere Analyse: Der Aufwand der reihenübergreifenden Aufmerksamkeit wächst mit der Zahl der Reihen pro Eingabe, sodass sehr breite Datensätze, etwa Tausende Produkte, eine Gruppierung brauchen können. Die Quellen nennen keine Obergrenze für die Zahl der Reihen; das Repository vermerkt nur, dass Kontexte über 15.360 Punkte auf die jüngsten Werte gekürzt werden.

  • Lizenzgrenzen. Die Gewichte von TimesFM 3.0 stehen unter einer nicht kommerziellen Lizenz, die kommerzielle oder produktive Nutzung heruntergeladener oder selbst betriebener Kopien ausschließt. Laut Repository ist eine solche Nutzung über autorisierte Google-Cloud-Dienste wie BigQuery ML erlaubt.
  • Ränge statt Fehlergrößen. Durchschnittsränge zeigen die Reihenfolge, nicht die Größe der Genauigkeitsunterschiede. Um den Nutzen für einen bestimmten Anwendungsfall zu beziffern, braucht es die zugrunde liegenden Werte oder einen eigenen Backtest.
  • Veranschaulichende Beispiele. Das Aktionsbeispiel im Beitrag zeigt ein Verhalten; es ist kein gemessenes Genauigkeitsergebnis.
  • Datenüberschneidung. Laut Modellkarte schließt das Vortraining GIFT-Eval-Vortrainingsdatensätze aus, die sich mit fev-bench überschneiden. Öffentliche Quellen wie Wikipedia-Seitenaufrufe und Google Trends sind aber enthalten; eine Evaluation auf diesen Reihen sollte daher auf Überschneidungen prüfen.

Warum das für angewandte KI und Unternehmens-KI wichtig ist

Unsere Analyse: TimesFM-3 verkleinert den Abstand zwischen schnellen Zero-Shot-Baselines und den kovariatenbewussten Modellen, die Planungsteams meist von Hand bauen. Wenn ein vortrainiertes Modell verwandte Reihen und bekannte künftige Ereignisse direkt aufnehmen kann, lassen sich Prognoseanwendungen testen, bevor in ein Training pro Datensatz investiert wird.

Der Beitrag von Google nennt Einsätze von Zeitreihen-Foundation-Models in Handel, Finanzwesen, Observability, Fertigung, Gesundheitswesen und Naturwissenschaften. In jedem Bereich lautet die nützliche Frage, ob bekannte künftige Eingaben, etwa Aktionen, Wartungsfenster oder Wettervorhersagen, die Genauigkeit genug verbessern, um den nötigen Datenaufwand zu rechtfertigen.

Daraus folgen drei praktische Prüfungen. Vergleichen Sie univariaten und multivariaten Modus in einem Backtest auf eigenen Daten, denn der Gewinn hängt davon ab, wie aussagekräftig die Kovariaten sind. Bewerten Sie neben der Punktprognose auch die Quantile, weil viele Planungsentscheidungen von der Streuung abhängen. Und klären Sie den Lizenzweg vor jedem produktiven Einsatz.

Wo ist TimesFM-3 erhältlich?

TimesFM-3 steht als PyTorch-Gewichte auf Hugging Face unter google/timesfm-3.0-pytorch bereit, der Code im Repository google-research/timesfm auf GitHub. Das Paket timesfm lässt sich über PyPI mit einer Erweiterung für PyTorch oder für MLX installieren.

Das Repository enthält univariate und multivariate Beispiele. Ein multivariater Aufruf erhält Zielreihen, geordnet nach Variable und Kontextlänge, optionale vergangene Kovariaten über denselben Kontext und vergangene und künftige Kovariaten, die über den Horizont reichen, und liefert je Zielreihe eine Prognose und 9 Quantile. Ein MLX-Backend läuft auf Apple Silicon: Auf einem M4 Max mit einem Kontext von 512 und einem Horizont von 64 meldet das Repository eine Median-Latenz von 11,1 ms für eine Reihe und 666 Reihen pro Sekunde bei einer Batchgröße von 32.

Für kommerzielle und produktive Nutzung verweist das Repository auf Google Cloud. Laut dem Update vom September 2026 ist TimesFM 3.0 in BigQuery ML vollständig ausgerollt; die Ankündigung hatte empfohlen, bis dahin TimesFM-2.5 über die Funktion AI.FORECAST in BigQuery auszuprobieren.

Fragen und Antworten

Was unterscheidet TimesFM-2.5 von TimesFM-3?

TimesFM-2.5 prognostiziert jede Reihe aus ihrer eigenen Historie; Kovariaten sind nur über eine Erweiterung namens XReg nutzbar. TimesFM-3 ist für multivariate Eingaben vortrainiert: Es prognostiziert mehrere Zielreihen gemeinsam, nutzt vergangene sowie vergangene und künftige Kovariaten nativ und dekodiert den gesamten Horizont in einem Durchgang statt Patch für Patch. Es hat 330 Millionen Parameter, gegenüber 200 Millionen bei TimesFM-2.5, und seine Gewichte stehen unter einer nicht kommerziellen Lizenz statt unter Apache 2.0.

Braucht TimesFM-3 ein Fine-Tuning?

Nein. TimesFM-3 ist für Zero-Shot-Prognosen ausgelegt: Es wird direkt auf Historie und Kovariaten eines neuen Datensatzes angewandt, ohne aufgabenspezifisches Training, und auch die multivariate Unterstützung braucht keine Anpassung pro Aufgabe. Das Repository enthält ein LoRA-Beispiel für das Fine-Tuning von TimesFM-2.5; ein TimesFM-Modell an Domänendaten anzupassen, bleibt also möglich, wo sich der Aufwand lohnt.

Was sind vergangene und künftige Kovariaten in der Zeitreihenprognose?

Das sind Eingaben, deren Werte sowohl für die Historie als auch für den Prognosehorizont bekannt sind, etwa ein Aktionskalender, Feiertage oder eine Wettervorhersage. Vergangene Kovariaten werden dagegen nur bis zur Gegenwart beobachtet. TimesFM-3 bildet für vergangene und künftige Kovariaten Vorgriffs-Tokens und hält sie über den Horizont sichtbar, sodass die Prognose auf jedes geplante Ereignis reagieren kann.

Darf TimesFM-3 kommerziell genutzt werden?

Nicht über die heruntergeladenen Gewichte. Laut Repository sind die vortrainierten Gewichte von TimesFM 3.0 auf nicht kommerzielle, nicht produktive Nutzung beschränkt, während der Quellcode und die Gewichte bis Version 2.5 unter Apache 2.0 bleiben. Kommerzielle und produktive Nutzung von TimesFM 3.0 ist über autorisierte Google-Cloud-Dienste wie BigQuery ML erlaubt, zu den Bedingungen von Google Cloud.

Wie drückt TimesFM-3 Prognoseunsicherheit aus?

Neben der Punktprognose gibt es für jede Zielreihe und jeden Horizontschritt 9 Quantilniveaus vom 10. bis zum 90. Perzentil aus. Die Spanne zwischen unteren und oberen Quantilen lässt sich als Bereich plausibler Ergebnisse lesen, und die Autoren bewerten das Modell auf allen drei Benchmarks nach probabilistischen Metriken ebenso wie nach Punktgenauigkeit.

Quellen

  1. Das, A., Kong, W., Sen, R., & Zhou, Y. (2024). A decoder-only foundation model for time-series forecasting. International Conference on Machine Learning (ICML 2024). arXiv:2310.10688. https://arxiv.org/abs/2310.10688 (externe Website)
  2. Google Research. (2026). TimesFM: Time Series Foundation Model [Computer software]. GitHub. https://github.com/google-research/timesfm (externe Website)
  3. Google. (2026). TimesFM 3.0 (PyTorch) [Model]. Hugging Face. https://huggingface.co/google/timesfm-3.0-pytorch (externe Website)
  4. Auer, A., Podest, P., Klotz, D., Böck, S., Klambauer, G., & Hochreiter, S. (2025). TiRex: Zero-shot forecasting across long and short horizons with enhanced in-context learning. Advances in Neural Information Processing Systems (NeurIPS 2025). arXiv:2505.23719. https://arxiv.org/abs/2505.23719 (externe Website)
  5. Aksu, T., Woo, G., Liu, J., Liu, X., Liu, C., Savarese, S., Xiong, C., & Sahoo, D. (2024). GIFT-Eval: A benchmark for general time series forecasting model evaluation. arXiv:2410.10393. https://arxiv.org/abs/2410.10393 (externe Website)
  6. Shchur, O., Ansari, A. F., Turkmen, C., Stella, L., Erickson, N., Guerron, P., Bohlke-Schneider, M., & Wang, Y. (2025). fev-bench: A realistic benchmark for time series forecasting. arXiv:2509.26468. https://arxiv.org/abs/2509.26468 (externe Website)
  7. Qiao, Z., Pan, S., Wang, A., Zhukova, V., Liu, Y., Jiang, X., Wen, Q., Long, M., Jin, M., & Liu, C. (2026). It's TIME: Towards the next generation of time series forecasting benchmarks. International Conference on Machine Learning (ICML 2026). arXiv:2602.12147. https://arxiv.org/abs/2602.12147 (externe Website)

Originalbeitrag

Jain, A., & Sen, R. (2026, 31 August). TimesFM-3: A zero-shot foundation model for multivariate forecasting. Google Research Blog. https://research.google/blog/timesfm-3-a-zero-shot-foundation-model-for-multivariate-forecasting/ (externe Website)

Dies ist eine unabhängige Zusammenfassung veröffentlichter Forschung durch Bibha. Bibha ist weder mit den Autorinnen und Autoren noch mit Google verbunden.

Alle Beiträge aus News und Forschung