Godot RL-Kurs
Lerne Deep Reinforcement Learning durch das Bauen und Trainieren von Agenten in echten Godot-Spielumgebungen.
Bevor du startest
Für wen dieser Kurs ist. Entwicklerinnen und Entwickler, die Spiele-KI mit Reinforcement Learning trainieren wollen. Du brauchst Python-Grundlagen (Funktionen, Schleifen, Skripte ausführen) und etwas Terminal-Erfahrung. Vorkenntnisse in Godot, Machine Learning oder RL sind nicht erforderlich — Neuronen, Netze und die RL-Schleife werden in Phase 1 von Grund auf aufgebaut. Die Mathematik bleibt auf Schulniveau (Algebra), und jede Formel wird zuerst mit konkreten Zahlen durchgerechnet.
Was du brauchst. Einen Desktop oder Laptop mit macOS, Windows oder Linux. Eine GPU hilft, ist aber nicht erforderlich — frühe Einheiten trainieren in Minuten auf der CPU, und die Zeitbox jeder Einheit nennt CPU- und GPU-Schätzungen. Sieh dir den Hardware-Setup-Leitfaden an, bevor du etwas kaufst.
Zeitaufwand. Jede Einheit beginnt mit einer Zeitschätzung. Unit 0 plus dein erstes Neuron passen in einen Abend (~2½–3 Std.); die meisten Einheiten brauchen 1–3 Stunden Aufmerksamkeit, längere Trainingsläufe laufen im Hintergrund.
Wo du anfängst. Schließe einmalig die Einrichtung ab — Kurs-Repo klonen, Godot und die Python-Umgebung installieren. Beginne dann mit Unit 0, deinem ersten Trainingslauf.
Was du bauen wirst
| Phase | Inhalt | Was du lernst |
|---|---|---|
| Phase 1 — Grundlagen | Einrichtung · neuronale Netze · RL-Schleife · Belohnungslernen · Deep Dive · erste eigene Umgebung · Belohnungsdesign | Von Neuronen zu Policies, wie RL funktioniert, wie man Belohnungen entwirft |
| Phase 2 — Wertbasiert | Q-Learning · DQN · Neugier | Bellman-Gleichung, Q-Tabellen, DQN, Erkundung bei spärlichen Belohnungen |
| Phase 3 — Richtlinienbasiert | REINFORCE · Actor-Critic · PPO · SAC · Anwenden · PPO von Grund auf (CleanRL) | Policy-Gradient-Theorem, PPO-Interna, kontinuierliche Steuerung |
| Phase 4 — Skalierung | Parallel · 3D · Multi-Agent · Gedächtnis | Realwelttraining in großem Maßstab |
| Phase 5 — Jenseits der Belohnung | Multi-Task RL · Imitationslernen · RLHF · Offline RL · Decision Transformer · ONNX/WASM · Abschlussprojekt | Alternative Lernsignale, generalistische Policies, Deployment |
| Phase 6 — Robotik | Robotersensoren · Lokomotion · Diffusion Policy · HER · Sim-to-Real · Safe RL | Roboter-Beobachtungs-/Aktionsdesign, zielkonditioniertes RL |
| Anleitungen | Debugging · Fortgeschrittene Evaluation · PBT · World Models | Systematische Diagnose, Evaluation, Hyperparameter-AutoML |
Drei Wege, deine KI zu sehen (jede Einheit)
| Kanal | Was er zeigt |
|---|---|
| Godot | Agentenverhalten in der Welt |
| TensorBoard | Lernkurven (tensorboard --logdir=logs) |
| AIController-Quellcode | Beobachtungen, Aktionen und Belohnungen, die du geändert hast |
Einheiten
Phase 1 — Grundlagen
- Einheit 0 — Einrichtung & Erster Start
- Mathe-Grundlagen 1 — Vektoren und Matrizen (optionale Auffrischung)
- Mathe-Grundlagen 2 — Wahrscheinlichkeit und Erwartungswert (optionale Auffrischung)
- Neuronale Grundlagen 1 — Ein Neuron
- Neuronale Grundlagen 2 — Kleine Netze
- RL Essentials
- Neuronale Grundlagen 3 — Aus Belohnung lernen
- RL Foundations Deep Dive
- Belohnungsdesign
- Einheit 2 — Erste eigene Umgebung
Phase 2 — Wertbasierte Methoden
Phase 3 — Richtlinienbasierte Methoden
- Policy Gradients & REINFORCE
- Actor-Critic
- PPO im Detail
- PPO in der Praxis (JumperHard)
- SAC — Soft Actor-Critic
- Anwenden — SAC vs PPO auf JumperHard
- PPO von Grund auf (CleanRL)
Phase 4 — Skalierung & Komplexität
- Paralleles Training
- Kontinuierliche 3D-Steuerung
- Visuelle Beobachtungen
- Multi-Agent
- Gedächtnis & POMDPs
- Self-Play
- Hierarchisches RL
Phase 5 — Jenseits der Belohnung
- Multi-Task RL
- Imitationslernen
- RLHF & Präferenzlernen
- Offline RL
- Decision Transformer
- KI deployen
- Abschlussprojekt
Phase 6 — Robotik
- Roboterbeobachtungen & Sensoren
- Fortbewegungsagenten
- Diffusion Policy
- Zielkonditioniertes RL & HER
- Sim-to-Real Transfer
- Safe RL / Constrained MDPs
Anleitungen
- Debugging im RL-Training
- Fortgeschrittene Evaluation
- Experiment-Tracking (W&B / MLflow)
- GPU-beschleunigte Umgebungen
- Population-Based Training
- World Models / DreamerV3
- Foundation Models für die Steuerung (VLA)
Nach diesem Kurs
Anschlusskurs: Model Alignment (separater Kurs)
Dieser Kurs endet bei ONNX-Vektor-Policies. Ein geplanter Folgekurs behandelt das Alignment von Sprachmodellen (SFT, Präferenzen, RLHF/DPO). Das Imitationslernen aus Unit 9 ist der Einstieg. Optional — die Units 0–10 sind für sich genommen vollständig.
Repository des Alignment-Kurses: demnächst verfügbar.
Übersetzung
Diese Seite ist auf Deutsch verfügbar. Weitere Einheiten werden schrittweise übersetzt.
Code-Blöcke bleiben auf Englisch — Programmiersprachen sind universell.
Möchtest du mithelfen? Öffne ein GitHub Issue mit dem Label translation.