Nvidias AVO hat eine perfekte Punktzahl von 100,00 RHAE auf dem öffentlichen ARC-AGI-3-Benchmark erreicht — alle 183 Level in 25 Spielumgebungen gemeistert und dabei etwa 12 Prozent weniger Umgebungsaktionen als das VISTA-System auf derselben Modellbasis verwendet.

Der ARC-AGI-3-Benchmark von François Chollet gilt weithin als eine der anspruchsvollsten Tests für KI-Begründung und Generalisierung. AVO erreicht dies durch eine geschichtete Architektur: persistenten Speicher, eine Überwachungsschleife und eine Kern-Agentenschleife.

Nvidia rahmt das Ergebnis als Beleg für seine These, dass das umgebende Harness die nachhaltige autonome Leistung stärker bestimmt als die rohe Modellfähigkeit selbst.