Accueil > Formations > Intelligence artificielle & Data Science > Ingénierie des LLMs & IA Générative > Ollama : déployer et optimiser des LLM en local
Ollama : déployer et optimiser des LLM en local
Maîtrisez le déploiement de modèles d'IA en local pour garantir la confidentialité de vos données tout en optimisant les performances !
Vue d'ensemble
- Connaissances de base en intelligence artificielle et en modèles de langage
- Pratique courante de la ligne de commande (Terminal, PowerShell)
- Bases en Python ou langage équivalent
- Notions de Docker (images, conteneurs)
Objectifs pédagogiques
Programme détaillé
Introduction à l'IA locale et aux modèles open-source
– Avantages de l’IA locale : confidentialité des données, réduction des coûts et maîtrise de la latence face aux solutions cloud
– Panorama des LLM open-source : positionnement et caractéristiques des modèles Llama, Mistral et Gemma
– Exigences matérielles : impact de la RAM, du GPU et de l’architecture sur les performances des modèles
– Architecture d’Ollama : fonctionnement interne, gestion des modèles et cas d’usage en entreprise
– Comparaison des performances et coûts entre un LLM local et une API cloud sur un même jeu de prompts
Installation et configuration d'Ollama
– Installation multi-plateforme : procédures spécifiques pour macOS, Windows et Linux
– Dépendances et accélération GPU : configuration de Docker et des drivers CUDA pour exploiter le matériel disponible
– Bonnes pratiques de configuration : organisation des modèles, gestion de l’espace disque et variables d’environnement
– Diagnostic et dépannage : résolution des problèmes courants d’installation et de compatibilité
– Installation d’Ollama et lancement d’un premier modèle léger
– Diagnostic et résolution de problèmes d’installation simulés
Utilisation et gestion des modèles
– Interface CLI : commandes essentielles pour télécharger, lancer et gérer les modèles
– Interface WebUI : interaction graphique avec les modèles pour le prototypage rapide
– Gestion du cycle de vie : téléchargement, mise à jour et suppression des modèles
– Techniques de prompting : rédaction de prompts efficaces et tests comparatifs entre modèles
– Lancement de plusieurs modèles et comparaison de leurs réponses sur des prompts variés
Personnalisation des modèles avec les Modelfiles
– Modelfiles : syntaxe et structure pour définir des modèles personnalisés
– Paramétrage avancé : ajustement de la température, du contexte et des instructions système
– Adaptation métier : spécialisation d’un modèle pour un domaine ou une tâche spécifique
– Fine-tuning de base : principes et limites de l’ajustement de modèles en local
– Création d’un Modelfile pour spécialiser un LLM sur la génération de code Python
– Personnalisation d’un modèle avec des instructions système adaptées à un contexte métier
Intégration applicative via l'API REST et LangChain
– API REST Ollama : endpoints disponibles, formats de requêtes et gestion des réponses en streaming
– Intégration Python : appels programmatiques à l’API pour intégrer Ollama dans des applications existantes
– LangChain et Ollama : configuration du connecteur, création de chaînes de traitement et gestion de la mémoire
– Création d’agents conversationnels : architecture d’un chatbot exploitant un modèle local
– Développement d’un chatbot simple intégrant l’API Ollama
– Construction d’une chaîne LangChain connectée à un modèle local
Optimisation des performances
– Quantization : réduction de la taille des modèles et impact sur la qualité des réponses
– Batching : traitement par lots pour améliorer le débit dans les scénarios multi-utilisateurs
– Stratégies de caching : mise en cache des résultats pour accélérer les réponses récurrentes
– Monitoring : suivi des métriques de performance (temps de réponse, consommation mémoire, utilisation GPU)
– Application de la quantization sur un modèle large et mesure de l’impact sur les performances et la qualité
– Mise en place d’un monitoring de base pour suivre l’utilisation des ressources
Sécurisation et déploiement en environnement sensible
– Isolation avec Docker : conteneurisation d’Ollama pour limiter la surface d’attaque
– Chiffrement des données : protection des modèles et des échanges en transit et au repos
– Contrôle d’accès : gestion des permissions et restriction de l’utilisation des modèles
– Cas d’usage en secteurs réglementés : déploiement dans des contextes santé, finance ou défense
– Déploiement d’Ollama dans un conteneur Docker sécurisé avec contrôle d’accès
– Développement d’un agent d’analyse de texte confidentiel exploitant un modèle local isolé
Prochaines sessions
Avis des participants
Financement
Cette formation est éligible aux financements OPCO et FNE-Formation. Nos équipes vous accompagnent dans le montage de votre dossier.
En savoir plus sur le financement
