diffusion_fusion2

Politique diffusion pour le bras SO-101, entrainee sur Zouzouw/fusion.

Ce n'est pas un entrainement independant : c'est la continuation de Zouzouw/diffusion_fusion. Meme dataset, meme learning rate, meme architecture — il reprend depuis le checkpoint du premier run et pousse l'entrainement plus loin.

Entrainement realise par Corentin Friedrich.

Dataset Zouzouw/fusion — uniquement celui-la, aucun fine-tuning
Learning rate 1e-04
Checkpoint etape 250 000
Politique Diffusion Policy
Repart de Zouzouw/diffusion_fusion

Non evalue

Ce checkpoint n'a pas ete mesure ni teste sur le robot. Il est publie pour ne pas le perdre.

Les contraintes de vitesse relevees sur le premier run s'appliquent tres probablement a l'identique : sur une GTX 1060 6 Go, la configuration d'origine gele la boucle de controle environ 28,5 s par bloc d'actions. Voir Zouzouw/diffusion_fusion pour le detail des mesures et les reglages de contournement.

Sur une machine plus puissante, cette piste redevient interessante — les policies diffusion produisent des gestes plus fluides que ACT, et rien ici ne dit que le modele est mauvais : seulement que cette carte graphique ne peut pas le faire tourner en temps reel.

Downloads last month
39
Safetensors
Model size
0.3B params
Tensor type
F32
·
Video Preview
loading