← Circuit RacingEXPÉRIENCE REPRODUCTIBLE · RACING Q-LEARNING V3
DQN et Double DQN,
à budget égal.
Cinq graines par méthode · 20 courses figées par pilote · 20 000 transitions d’entraînement · tensorflow, TensorFlow.js 4.22.0
DQN
42/100
courses réussies · 61/100 terminées
Réussite par graine : moyenne 42.0 %, écart-type 38.0 points ; 0.0–85.0 %.
Double DQN
33/100
courses réussies · 77/100 terminées
Réussite par graine : moyenne 33.0 %, écart-type 33.0 points ; 0.0–80.0 %.
Ces résultats décrivent ce circuit, ce curriculum et ce budget. Ils ne démontrent pas une supériorité générale de l’un des algorithmes. Les graines d’évaluation ne varient que légèrement le cap initial ; ces courses ne constituent pas 200 scénarios indépendants. Tous les checkpoints finaux et tous les échecs sont conservés.
Chaque graine, sans sélection
Ce qui est identique
- Réseau 20 → 32 → 32 → 9, ReLU et sorties Q linéaires ; Adam 0,001 ; replay 10 000 ; batch 32 ; gamma 0,99.
- 20 000 décisions, chacune maintenue six ticks physiques de 1/60 s. Mise à jour toutes les quatre transitions et copie cible toutes les 100 mises à jour. Dernier checkpoint programmé ; aucune sélection sur l’évaluation.
- Exploration, replay et initialisation pilotés par la graine. Pas de mélange aléatoire supplémentaire dans fit.
- Entraînement sur Alpine Park : 10 000 décisions solo, puis 10 000 avec trois références figées ; départs variés sur la piste, vitesse initiale 4–12 m/s, épisodes limités à 600 décisions. Les sorties restent récupérables avec les mêmes remises en piste et pénalités que la course. Récompense de progression, checkpoints et pénalités. Aucun label ni remplacement par un pilote à règles.
- Conduite et course V2 : barrières continues, collisions voiture/voiture et voiture/rail, sortie ralentie (+2 s), remise après immobilisation dans un rayon de 1 m pendant 5 s (+5 s). Les mêmes contraintes valent dans tous les modes.
- Évaluation complète : cinq caps initiaux par circuit et par condition solo/trafic. Alpine Park et Harbour Test, trois tours, plafond 300 s. Trafic constitué de références à règles figées identiques pour les deux méthodes.
- Réussite : trois tours, aucune remise en piste, pénalité ≤ 10 s. Une course terminée peut échouer à ce critère.
Temps et limites
Temps réels mesurés sur darwin/arm64, Node v22.14.0, Apple M4, 16 Gio. La machine exécutait aussi la démo navigateur ; les temps ne proviennent pas d’une machine isolée. Le premier passage inclut davantage de démarrage à froid ; les temps ne servent pas de classement de vitesse. Les départs variés du curriculum d’entraînement diffèrent des départs de course arrêtés : les échecs de transfert restent mesurés.
Les reprises navigateur rechargent les poids et recréent optimiseur, replay et exploration. Ce benchmark utilise uniquement des entraînements neufs. Les poids de cette page sont des résultats expérimentaux ; leur présence ne garantit pas un adversaire compétent.
Télécharger les 200 résultats bruts, paramètres, versions et empreintes des sources
Reproduction : pnpm exec tsx --tsconfig scripts/tsconfig.racing.json scripts/compare-racing-q.mts, puis node scripts/report-racing-q.mjs. Le script refuse d’écraser un protocole existant ; déplacer le dossier de résultats avant une nouvelle expérience.
Calcul Double DQN : sélection online, évaluation cible, selon van Hasselt, Guez et Silver.