NVIDIA LocateAnything-3B : jusqu'à 2,5× plus rapide en localisation visuelle, sous licence recherche
D'après La page officielle du modèle : nvidia/LocateAnything-3B (Hugging Face)
Image : générée (Gemini)
Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.
À retenir
- Le coeur : le Parallel Box Decoding (PBD). Les modèles habituels sérialisent chaque boîte 2D en jetons décodés un par un (goulot d'inférence) ; LocateAnything décode chaque boîte comme une unité atomique en une seule étape, ce qui préserve la cohérence géométrique et débloque le parallélisme.
- Résultat mesuré sur divers bancs d'essai : PBD améliore à la fois le débit de décodage et la précision de localisation (haute IoU). NVIDIA rapporte jusqu'à 2,5× de débit par rapport aux approches antérieures.
- Architecture : un backbone langage Qwen2.5-3B relié à un encodeur visuel MoonViT. NVIDIA l'appelle « 3B » (le backbone) ; Hugging Face affiche environ 4B pour les poids hébergés, qui comptent aussi la partie vision - même modèle, deux façons de compter.
- Le nerf de la performance : un moteur de données a produit LocateAnything-Data, plus de 138 millions d'échantillons d'entraînement. C'est cette échelle, combinée au PBD, qui pousse la frontière vitesse-précision.
- Licence NVIDIA non commerciale : usage réservé à la recherche académique et à but non lucratif, usage commercial interdit. À vérifier avant tout prototype destiné à un produit payant.
Pourquoi ça compte
Pour qui construit des agents interactifs, de la robotique, de la conduite autonome ou de l'analyse de documents, le goulot n'est souvent pas de comprendre l'image mais de la localiser assez vite quand elle contient beaucoup d'objets - c'est exactement ce que le Parallel Box Decoding attaque. La limite : la licence non commerciale réserve l'outil à la recherche pour l'instant.
Chiffre-clé
Plus de 138 millions d'échantillons d'entraînement dans le jeu de données LocateAnything-Data, selon l'article arXiv publié le 26 mai 2026.
Citation
« By decoding geometric elements such as bounding boxes and points as atomic units in a single step, LocateAnything preserves intra-box geometric coherence and unlocks substantial parallelism. (En français : « en décodant les éléments géométriques comme des unités atomiques en une seule étape, le modèle préserve la cohérence de la boîte et débloque un parallélisme important ».) » Article arXiv « LocateAnything », NVIDIA Research (26 mai 2026)
Action concrète
Le modèle et le code sont publics (Hugging Face nvidia/LocateAnything-3B, GitHub NVlabs/Eagle) : les équipes de recherche peuvent les essayer dès maintenant. Mais vérifiez la licence AVANT tout prototype destiné à la production - l'usage commercial est interdit en l'état.
Repères datés
- 26 mai 2026 - Soumission de l'article arXiv (v1) et publication du modèle sur Hugging Face et de la page NVIDIA Research
- 27 mai 2026 - Révision v2 de l'article arXiv
Fondée sur la source originale