Hy4 usa arquitectura Mixture-of-Experts con 78 capas y solo dos niveles de razonamiento (high y no_think), optimizando costos de inferencia al activar solo 49B de sus 770B parámetros por token. El modelo está disponible gratis en Hugging Face y OpenRouter, pero requiere un clúster GPU significativo para autohospedaje (1,56 TB) y los datos vía API están sujetos a leyes chinas de ciberseguridad e inteligencia nacional.