MXFP4
Format numérique à 4 bits en virgule flottante avec facteurs d'échelle partagés par blocs, utilisé notamment par les modèles gpt-oss pour leurs couches d'experts.
Format numérique à 4 bits en virgule flottante avec facteurs d'échelle partagés par blocs, utilisé notamment par les modèles gpt-oss pour leurs couches d'experts.
MXFP4 (Microscaling FP4) code chaque poids sur 4 bits, avec une échelle commune à un petit bloc de valeurs. Contrairement aux quantifications appliquées après coup, certains modèles sont entraînés ou publiés directement dans ce format.
Pour la Box, cela signifie qu'un modèle comme gpt-oss-120b est « déjà petit » à sa sortie et qu'il n'y a pas à arbitrer entre plusieurs niveaux de quantification pour ses experts. Le support du format par le backend GPU (Vulkan ou ROCm) est à vérifier.