Présentation de l’implémentation du watermarking de texte dans vLLM, basée sur la technique Gumbel-max qui préserve la distribution de sortie du modèle. L’article détaille les kernels GPU utilisés, la détection statistique, la compatibilité avec le speculative decoding et la gestion des n-grammes répétés. Il aborde également les compromis entre non-distortion, robustesse et performance dans un moteur d’inférence à haut débit.
Commentaires
Vous devez
vous inscrire
ou
vous connecter
pour poster un commentaire