Zum Inhalt

Godot RL-Kurs

Lerne Deep Reinforcement Learning durch das Bauen und Trainieren von Agenten in echten Godot-Spielumgebungen.

Bevor du startest

Für wen dieser Kurs ist. Entwicklerinnen und Entwickler, die Spiele-KI mit Reinforcement Learning trainieren wollen. Du brauchst Python-Grundlagen (Funktionen, Schleifen, Skripte ausführen) und etwas Terminal-Erfahrung. Vorkenntnisse in Godot, Machine Learning oder RL sind nicht erforderlich — Neuronen, Netze und die RL-Schleife werden in Phase 1 von Grund auf aufgebaut. Die Mathematik bleibt auf Schulniveau (Algebra), und jede Formel wird zuerst mit konkreten Zahlen durchgerechnet.

Was du brauchst. Einen Desktop oder Laptop mit macOS, Windows oder Linux. Eine GPU hilft, ist aber nicht erforderlich — frühe Einheiten trainieren in Minuten auf der CPU, und die Zeitbox jeder Einheit nennt CPU- und GPU-Schätzungen. Sieh dir den Hardware-Setup-Leitfaden an, bevor du etwas kaufst.

Zeitaufwand. Jede Einheit beginnt mit einer Zeitschätzung. Unit 0 plus dein erstes Neuron passen in einen Abend (~2½–3 Std.); die meisten Einheiten brauchen 1–3 Stunden Aufmerksamkeit, längere Trainingsläufe laufen im Hintergrund.

Wo du anfängst. Schließe einmalig die Einrichtung ab — Kurs-Repo klonen, Godot und die Python-Umgebung installieren. Beginne dann mit Unit 0, deinem ersten Trainingslauf.

Was du bauen wirst

Phase Inhalt Was du lernst
Phase 1 — Grundlagen Einrichtung · neuronale Netze · RL-Schleife · Belohnungslernen · Deep Dive · erste eigene Umgebung · Belohnungsdesign Von Neuronen zu Policies, wie RL funktioniert, wie man Belohnungen entwirft
Phase 2 — Wertbasiert Q-Learning · DQN · Neugier Bellman-Gleichung, Q-Tabellen, DQN, Erkundung bei spärlichen Belohnungen
Phase 3 — Richtlinienbasiert REINFORCE · Actor-Critic · PPO · SAC · Anwenden · PPO von Grund auf (CleanRL) Policy-Gradient-Theorem, PPO-Interna, kontinuierliche Steuerung
Phase 4 — Skalierung Parallel · 3D · Multi-Agent · Gedächtnis Realwelttraining in großem Maßstab
Phase 5 — Jenseits der Belohnung Multi-Task RL · Imitationslernen · RLHF · Offline RL · Decision Transformer · ONNX/WASM · Abschlussprojekt Alternative Lernsignale, generalistische Policies, Deployment
Phase 6 — Robotik Robotersensoren · Lokomotion · Diffusion Policy · HER · Sim-to-Real · Safe RL Roboter-Beobachtungs-/Aktionsdesign, zielkonditioniertes RL
Anleitungen Debugging · Fortgeschrittene Evaluation · PBT · World Models Systematische Diagnose, Evaluation, Hyperparameter-AutoML

Drei Wege, deine KI zu sehen (jede Einheit)

Kanal Was er zeigt
Godot Agentenverhalten in der Welt
TensorBoard Lernkurven (tensorboard --logdir=logs)
AIController-Quellcode Beobachtungen, Aktionen und Belohnungen, die du geändert hast

Einheiten

Phase 1 — Grundlagen

Phase 2 — Wertbasierte Methoden

Phase 3 — Richtlinienbasierte Methoden

Phase 4 — Skalierung & Komplexität

Phase 5 — Jenseits der Belohnung

Phase 6 — Robotik

Anleitungen

Nach diesem Kurs

Anschlusskurs: Model Alignment (separater Kurs)

Dieser Kurs endet bei ONNX-Vektor-Policies. Ein geplanter Folgekurs behandelt das Alignment von Sprachmodellen (SFT, Präferenzen, RLHF/DPO). Das Imitationslernen aus Unit 9 ist der Einstieg. Optional — die Units 0–10 sind für sich genommen vollständig.

Repository des Alignment-Kurses: demnächst verfügbar.


Übersetzung

Diese Seite ist auf Deutsch verfügbar. Weitere Einheiten werden schrittweise übersetzt. Code-Blöcke bleiben auf Englisch — Programmiersprachen sind universell. Möchtest du mithelfen? Öffne ein GitHub Issue mit dem Label translation.