Présentation de l’implémentation du watermarking de texte dans vLLM, basée sur la technique Gumbel-max qui préserve la distribution de sortie du modèle. L’article détaille les kernels GPU utilisés, la détection statistique, la compatibilité avec le speculative decoding et la gestion des n-grammes répétés. Il aborde également les compromis entre non-distortion, robustesse et performance dans un moteur d’inférence à haut débit.

Commentaires

Vous devez vous inscrire ou vous connecter pour poster un commentaire