Vue d'ensemble
J'ai piloté le delivery de bout en bout de DAISI (Decathlon AI Supplier Informations), Enterprise Agent en production dans Google Chat pour les workflows fournisseurs et finance. Le travail a commencé par des réunions de cadrage client et la modélisation des processus, puis a couvert l'architecture, les intégrations Workday Finance et systèmes métier, l'implémentation, l'évaluation, la validation sécurité, le déploiement et l'adoption. DAISI combine outils métier agentiques, RAG gouverné, Gemini, Vertex AI Vector Search, Cloud Run, Cloud SQL, MLflow/Databricks, Model Armor, DLP, OpenTelemetry et Terraform. Il a été conçu pour une population cible de 10 000 utilisateurs et load testé avec succès à 2 000 utilisateurs concurrents. L'application fonctionne en production avec une gestion automatisée de l'infrastructure et une observabilité de bout en bout. Son impact annualisé communiqué est de 13 000 heures/an économisées sur les workflows de support fournisseurs.Impact Métier
| Indicateur | Valeur |
|---|---|
| Population cible | Conçu pour soutenir 10 000 utilisateurs |
| Impact annualisé communiqué | 13 000 heures/an économisées sur les workflows de support fournisseurs |
| Load test | Test réussi avec 2 000 utilisateurs concurrents |
| Disponibilité | Réponses instantanées 24/7 vs. attente d'une réponse humaine |
| Couverture | Fondé sur des procédures fournisseurs et finance gouvernées |
| Escalade | Routage automatique vers l'expert humain approprié si nécessaire |
Mes responsabilités
- Pilotage des réunions de cadrage client, de la clarification des besoins, des décisions d'architecture et du plan de delivery
- Construction de l'agent ReAct LangGraph, du retrieval gouverné, des interfaces d'outils, de la persistance, des contrôles de sécurité et du runtime cloud
- Intégration de Workday Finance et d'autres services métier approuvés derrière des frontières d'outils contrôlées
- Conception d'interfaces d'interopérabilité compatibles A2A pour partager des capacités entre agents
- Développement d'une Agent Factory interne avec librairies, templates, évaluation, observabilité, sécurité et conventions de déploiement, améliorant le time-to-market jusqu'à 5×
- Conception des tests d'intégration et de rapports détaillés couvrant le fonctionnel, la fiabilité, la sécurité, la latence, les coûts et le passage à l'échelle
- Optimisation du cache, de l'usage des modèles, des traitements asynchrones, de l'autoscaling et de l'observabilité pour les coûts et la latence en production
- Présentation des pratiques de développement d'agents à 100+ collaborateurs et contribution à l'enablement via formations, documentation, supports d'onboarding et runbooks
Architecture Technique
Stack IA/ML
- LangGraph - Framework d'orchestration d'agents avec flux conversationnels à état
- LangChain - Framework applicatif LLM pour les chaînes et les prompts
- Gemini via Vertex AI - Modèle fondation pour la génération de texte
- Vertex AI Vector Search - Recherche sémantique haute performance pour le RAG
- FAISS - Recherche locale de similarité vectorielle
- Model Armor - Templates de sécurité GCP pour la protection anti-prompt injection et le filtrage de contenu
- DLP - Protection des informations sensibles
Infrastructure Backend
- FastAPI - Framework API asynchrone haute performance
- Cloud Run - Déploiement serverless de conteneurs avec autoscaling
- Cloud SQL PostgreSQL - Base de données managée pour la persistance des conversations
- Google Cloud Storage - Stockage objet pour la base de connaissances et les configurations
- Uvicorn - Serveur ASGI pour FastAPI
Observabilité & MLOps
- MLflow 3.7+ - Suivi d'expériences avec autologging LangGraph
- Databricks - Workflows MLflow et refresh Delta
- LiteLLM - Passerelle API LLM unifiée
- OpenTelemetry - Traçage distribué avec export OTLP/gRPC
- Cloud Logging - Agrégation centralisée des logs
Automatisation opérationnelle
Des jobs Cloud Run et workflows planifiés prennent en charge des opérations de cycle de vie telles que l'application des règles de rétention, l'évaluation des traces et la synchronisation gouvernée des connaissances. Cette étude de cas publique omet volontairement les horaires, identifiants et systèmes sources internes.Infrastructure as Code
- Terraform - Gestion modulaire du runtime, des workloads planifiés, des frontières d'identité, des contrôles de sécurité, de l'infrastructure de retrieval et du stockage
DevOps & CI/CD
- Docker - Déploiements conteneurisés
- GitHub Actions - Pipelines CI/CD automatisés
- SonarCloud - Analyse de qualité de code et de sécurité
- Pre-commit hooks - Vérifications automatisées du code
- Ruff - Linting et formatage Python
- Mypy - Vérification statique de types
- Pytest - Framework de tests asynchrones avec couverture
Gestion de Projet
- Jira - Planification de sprints et suivi des tickets
- Confluence - Documentation technique avec synchronisation automatique depuis /docs
Vue d'architecture publique
L'architecture publique est volontairement assainie. À haut niveau, les événements Google Chat entrent dans un runtime FastAPI sur Cloud Run, passent par les contrôles d'authentification et de sécurité en entrée, puis atteignent un agent LangGraph. L'agent peut récupérer des preuves gouvernées, appeler des outils métier approuvés, conserver l'état conversationnel et exposer des frontières d'interface compatibles A2A. Les contrôles de sortie sont appliqués avant le retour à l'utilisateur, tandis que les traces et signaux d'évaluation sont enregistrés de manière asynchrone. Cette séparation rend le système compréhensible et testable :- Frontière canal et API pour l'authentification, l'idempotence et la livraison des réponses
- Frontière sécurité pour la protection contre l'injection de prompts, les contrôles de données sensibles et les politiques
- Runtime agent pour la planification, le retrieval, les outils, la mémoire et l'interopérabilité compatible A2A
- Frontière d'intégration entreprise pour les services finance et fournisseurs approuvés
- Frontière d'observabilité pour les traces, l'évaluation qualité, la latence, les coûts et les rapports opérationnels
Fonctionnalités Principales
Réponses Intelligentes aux Questions
Réponses alimentées par le RAG, fondées sur les guides pratiques opérationnels et comptables (fiches pratiques).Désambiguïsation Contextuelle
Conversations multi-tours avec questions de suivi pour clarifier les demandes ambiguës.Mémoire Conversationnelle
Checkpointer adossé à PostgreSQL pour un état conversationnel persistant avec authentification IAM.Intégrations Système
- Contexte d'identité - Contexte utilisateur autorisé pour délimiter les réponses et les outils
- Workday Finance - Intégration contrôlée pour les workflows finance approuvés
- Routage vers un expert humain - Escalade vers le bon interlocuteur support
- Outils fournisseurs et achats - APIs approuvées exposées via des outils typés
- Interfaces compatibles A2A - Frontières conçues pour des capacités gouvernées réutilisables
Sécurité & Conformité
- Templates Model Armor pour la protection contre l'injection de prompts
- DLP pour protéger les informations sensibles
- Gestion par politiques des sujets interdits ou hors périmètre
- Rétention des données conforme au RGPD avec nettoyage TTL automatisé
- Contrôle d'accès fondé sur l'identité et frontières de services à privilèges minimaux
- Rapports de tests d'intégration et de sécurité utilisés comme preuves de préparation à la production
Résumé des Technologies
| Catégorie | Technologies |
|---|---|
| IA/ML | LangGraph, LangChain, Gemini, Vertex AI Vector Search, FAISS, Model Armor, DLP |
| Backend | Python 3.11, FastAPI, Uvicorn, Pydantic |
| Base de données | Cloud SQL PostgreSQL, langgraph-checkpoint-postgres, psycopg3 |
| Cloud | GCP, Cloud Run, Cloud Run Jobs, Cloud Scheduler, GCS |
| Observabilité | MLflow, Databricks, LiteLLM, OpenTelemetry |
| Infrastructure | Terraform, Docker |
| CI/CD | GitHub Actions, SonarCloud, Pre-commit |
| Qualité | Ruff, Mypy, Pytest, pytest-asyncio |
