Aller au contenu principal
LLM

Sélection du modèle

Écrit par Stanislas

Dernière mise à jour Il y a 16 jours

Vue d'ensemble

La sélection du modèle vous permet de choisir le grand modèle de langage (LLM) qui alimente votre agent IA. Vous pouvez configurer un modèle principal, définir un modèle de secours (fallback) automatique pour garantir une haute disponibilité sans interruption, et ajuster les paramètres d'exécution essentiels tels que l'effort de raisonnement et la température.

Choisir le bon modèle permet d'équilibrer l'intelligence, la vitesse de réponse, la confidentialité des données et la consommation de crédits selon vos besoins métier.


Prérequis

  • Un compte Swiftask sur n'importe quel forfait actif.

  • Les droits de création ou de modification d'agents dans votre espace de travail (Administrateur, Propriétaire ou Membre disposant de l'accès à la gestion des agents).

  • Un agent existant ou un nouveau brouillon d'agent en cours de configuration.


Guide étape par étape

1. Ouvrir la configuration du LLM

  1. Accédez à l'écran de configuration de votre agent.

  2. Dans le panneau de navigation de gauche, cliquez sur Agent Instruction pour déplier la section.

  3. Sélectionnez LLM.

2. Choisir votre modèle LLM principal

  1. Sous le champ LLM Model, cliquez sur la liste déroulante pour ouvrir la bibliothèque de modèles.

  2. Parcourez les modèles par catégorie (comme Best for most tasks, Cost effective, Anthropic - Claude, OpenAI, OpenAI - Azure 🇪🇺, Bedrock 🇪🇺 ou Scaleway hosting 🇪🇺), ou utilisez la barre de recherche pour trouver un modèle par son nom.

  1. Vérifiez les caractéristiques du modèle dans le panneau de prévisualisation à droite avant de valider votre choix :

  • Credits : Le coût de facturation par mot traité (ex. 1.6 credit(s)/word).

  • Context : La taille maximale du contexte en entrée en tokens (ex. 1 040 000 tokens).

  • Output : La longueur maximale de réponse en tokens (ex. 127 000 tokens).

  1. Cliquez sur le modèle choisi pour le définir comme LLM principal.

3. Filtrer les modèles par niveau de confidentialité

Pour respecter votre gouvernance de données et vos exigences de conformité, filtrez les modèles à l'aide de la liste déroulante Privacy :

  • 🛡️ 1 bouclier (API Fournisseur) : Les requêtes sont traitées directement via les points de terminaison d'API standards du fournisseur avec des accords d'absence de rétention de données.

  • 🛡️🛡️ 2 boucliers (Hébergement cloud européen) : Modèles hébergés au sein de l'Union européenne sur des infrastructures comme AWS Bedrock EU ou Azure EU pour garantir la conformité RGPD et la résidence des données.

  • 🛡️🛡️🛡️ 3 boucliers (Cloud souverain français) : Modèles hébergés sur l'infrastructure Scaleway en France, assurant un hébergement souverain et une isolation stricte des données pour les cas d'usage hautement sensibles.

4. Configurer un LLM de secours optionnel (Fallback)

Un modèle de secours assure la continuité du service si votre modèle principal rencontre des limites de débit, des pannes ou des ralentissements temporaires du fournisseur.

  1. Sous Fallback LLM (in case of failure of the main LLM), cliquez sur le menu déroulant.

  2. Sélectionnez un modèle de remplacement dans la liste.

  3. Si vous ne souhaitez plus utiliser de modèle de secours, cliquez sur Remove fallback LLM à côté du champ.

Lorsqu'une erreur survient sur le modèle principal, Swiftask bascule automatiquement la requête sur le modèle de secours de manière transparente pour l'utilisateur.

5. Ajuster l'effort de raisonnement (Reasoning effort)

Lorsque vous sélectionnez un modèle principal prenant en charge la réflexion approfondie (comme les modèles Anthropic Claude avec extended thinking), le réglage Reasoning effort apparaît dynamiquement sous le sélecteur de modèle.

  1. Repérez la section Reasoning effort.

  2. Choisissez l'une des trois profondeurs d'analyse :

  • Low : Réponses rapides avec un raisonnement interne minimal. Idéal pour les tâches simples et récurrentes.

  • Medium : Équilibre entre profondeur d'analyse et temps de réponse pour la logique métier courante.

  • High : Évaluation analytique approfondie avant de répondre. Recommandé pour l'extraction de données complexes, la validation logique et le code.

Remarque : Les niveaux de raisonnement élevés génèrent davantage de tokens lors de la phase de réflexion, ce qui augmente la consommation de crédits par message.

6. Configurer la température

Le réglage de la température contrôle le compromis entre la précision déterministe et la créativité des réponses.

  1. Faites défiler jusqu'à la section Temperature.

  2. Déplacez le curseur ou saisissez une valeur décimale entre 0.0 et 1.0 :

  • 0.0 à 0.3 (Strict et déterministe) : Génère des réponses cohérentes, factuelles et reproductibles avec un minimum de variation.

  • 0.4 à 0.7 (Équilibré) : Offre une fluidité conversationnelle naturelle tout en maintenant une structure rigoureuse.

  • 0.8 à 1.0 (Créatif et varié) : Encourage la diversité du vocabulaire et des formulations originales.


Cas d'usage pratiques

Assistant juridique et de conformité souverain

  • Configuration : Modèle principal avec 🛡️🛡️🛡️ 3 boucliers (cloud souverain Scaleway), température réglée sur 0.1.

  • Résultat : Respect strict de la conformité réglementaire où les politiques internes et contrats ne quittent jamais le territoire français, avec des citations précises sans hallucination.

Agent de support client à haute disponibilité

  • Configuration : Modèle principal rapide (ex. modèle économique hébergé en UE) associé à un modèle de secours sous Fallback LLM, température réglée sur 0.5.

  • Résultat : Réponses instantanées, courtoises et fiables avec une garantie de continuité de service même en cas d'interruption du fournisseur principal.

Agent d'analyse financière et de prévision complexe

  • Configuration : Modèle de raisonnement avancé avec Reasoning effort sur High, température réglée sur 0.2.

  • Résultat : Analyse mathématique et logique rigoureuse de longs rapports financiers avant génération des synthèses chiffrées.


Conseils et bonnes pratiques

  • Adapter le modèle à la tâche : Évitez d'utiliser des modèles haut de gamme coûteux pour des tâches simples de mise en forme ou de recherche documentaire basique. Privilégiez les modèles économiques pour les volumes importants.

  • Démarrer de nouvelles sessions de conversation : La consommation de crédits dépend du volume total de mots traités (invites, historique, outils, documents extraits). Ouvrir une nouvelle session réinitialise l'historique et réduit les coûts.

  • Baisser la température pour les agents utilisant des outils : Lorsque votre agent utilise des compétences (skills) ou des API externes, baissez la température (entre 0.0 et 0.2) pour garantir la conformité aux schémas de paramètres JSON.

  • Sélectionner des modèles de secours complémentaires : Choisissez un modèle de secours issu d'un fournisseur cloud distinct de votre modèle principal afin d'éviter les pannes d'infrastructure communes.


Dépannage

Pourquoi mon agent bascule-t-il fréquemment sur le LLM de secours ?

  • Cause : Votre fournisseur principal subit des ralentissements momentanés, des dépassements de quotas ou une indisponibilité régionale.

  • Solution : Vérifiez le solde de crédits de votre espace de travail et l'état opérationnel du fournisseur. Si les coupures persistent, sélectionnez un autre modèle principal dans le même palier de confidentialité.

Pourquoi le réglage de l'effort de raisonnement ne s'affiche-t-il pas ?

  • Cause : La section Reasoning effort n'est disponible que pour les modèles supportant la réflexion étendue (chain-of-thought).

  • Solution : Vérifiez le modèle principal choisi. Sélectionnez un modèle compatible (notamment certaines variantes Anthropic Claude) pour afficher l'option.

Pourquoi les réponses structurées ou les appels d'outils comportent-ils des erreurs ?

  • Cause : Une température trop haute (supérieure à 0.7) introduit de l'aléatoire et peut altérer la syntaxe des arguments d'outils.

  • Solution : Réduisez la température à 0.2 ou 0.0 pour rétablir une exécution stricte et déterministe.


Ressources complémentaires

  • Agent profile : Définir l'identité, l'avatar et les informations générales de l'agent.

  • Agent instructions settings : Rédiger le prompt système, les règles et le comportement de votre agent.

  • Best practices for optimizing Swiftask credit usage : Comprendre l'impact de la taille du contexte et du choix du modèle sur la consommation de crédits.

Cela a-t-il été utile ?

Besoin d'aide supplémentaire ? Demander à l'équipe