Skip to main content

Évaluer des modèles avec Weave

W&B Weave est une boîte à outils spécialement conçue pour évaluer les LLM et les applications d’IA générative. Elle offre des fonctionnalités d’évaluation complètes, notamment des évaluateurs, des juges et un Tracing détaillé, pour vous aider à comprendre et à améliorer les performances du modèle. Weave s’intègre à W&B Models, ce qui vous permet d’évaluer les modèles stockés dans votre registre de modèles.

Fonctionnalités clés pour l’évaluation des modèles

  • Évaluateurs et juges : Métriques d’évaluation prédéfinies et personnalisées pour l’exactitude, la pertinence, la cohérence, etc.
  • Jeux de données d’évaluation : Ensembles de test structurés avec des valeurs de référence pour une évaluation systématique
  • Gestion des versions des modèles : Suivez et comparez différentes versions de vos modèles
  • Tracing détaillé : Déboguez le comportement du modèle à l’aide de traces d’entrée/sortie complètes
  • Suivi des coûts : Surveillez les coûts d’API et l’utilisation des tokens sur l’ensemble des évaluations

Premiers pas : évaluer un modèle à partir du W&B Registry

Téléchargez un modèle depuis le registre W&B Models et évaluez-le à l’aide de Weave :

Intégrer les évaluations Weave à W&B Models

La démo d’intégration Models and Weave présente le flux de travail complet pour :
  1. Charger des modèles depuis le registre : téléchargez des modèles affinés stockés dans le registre de W&B Models
  2. Créer des pipelines d’évaluation : créez des évaluations complètes avec des évaluateurs personnalisés
  3. Consigner les résultats dans W&B : associez les métriques d’évaluation aux runs de vos modèles
  4. Versionner les modèles évalués : enregistrez les modèles améliorés dans le registre
Consignez les résultats d’évaluation à la fois dans Weave et W&B Models :

Fonctionnalités avancées de Weave

Évaluateurs et juges personnalisés

Créez des métriques d’évaluation sophistiquées adaptées à votre cas d’utilisation :

Évaluations par lot

Évaluez plusieurs versions de modèle ou plusieurs configurations :

Étapes suivantes

Évaluer des modèles avec W&B Tables

Utilisez W&B Tables pour :
  • Comparer les prédictions des modèles : affichez côte à côte les performances de différents modèles sur le même jeu de test
  • Suivre l’évolution des prédictions : observez comment les prédictions changent au fil des époques d’entraînement ou des versions du modèle
  • Analyser les erreurs : filtrez et lancez des requêtes pour trouver les exemples fréquemment mal classés et les schémas d’erreur
  • Visualiser des médias enrichis : affichez des images, de l’Audio, du texte et d’autres types de médias à côté des prédictions et des métriques

Exemple de base : journaliser les résultats d’évaluation

Flux de travail avancés avec les tableaux

Comparer plusieurs modèles

Enregistrez les tableaux d’Évaluation de différents modèles avec la même clé afin de les comparer directement :

Suivre les prédictions au fil du temps

Enregistrez des tableaux dans le journal à différentes époques d’entraînement pour visualiser les améliorations :

Analyse interactive dans l’interface W&B

Une fois les résultats enregistrés, vous pouvez :
  1. Filtrer les résultats : cliquez sur les en-têtes de colonne pour filtrer selon la précision des prédictions, les seuils de confiance ou des classes spécifiques
  2. Comparer des tables : sélectionnez plusieurs versions de table pour afficher des comparaisons côte à côte
  3. Interroger les données : utilisez la barre de requête pour trouver des motifs précis (par exemple, "correct" = false AND "confidence" > 0.8)
  4. Grouper et agréger : regroupez par classe prédite pour voir les métriques de précision par classe

Exemple : analyse des erreurs avec des Tables enrichies