Passer au contenu principal

AWS Startups

Création d’agents d’IA conçus pour la mise à l’échelle : architecture sans serveur sur AWS

18 février 2026

Créer des agents d’IA pouvant être mis à l’échelle grâce au sans serveur

 

La création de logiciels à l’ère de l’IA générative présente un paradoxe. D’un côté, les modèles de connaissances frontières sont devenus si puissants que créer une première version d’une application basée sur l’IA peut se résumer à appeler une simple API de chat, avec un agent de codage qui rédige la majeure partie du code. De l’autre, le niveau de précision, de performances et d’optimisation des coûts exigé par une application d’IA prête pour la production suppose souvent une architecture technique complexe.

Cette complexité vient en partie du fait que les algorithmes d’IA générative sont probabilistes plutôt que déterministes. Pour réduire la variance des sorties d’un modèle et améliorer sa fiabilité, les développeurs utilisent des techniques comme fournir des exemples de « bonne » réponse ou ajouter des informations supplémentaires (« contexte ») que le modèle peut prendre en compte lorsqu’il génère sa sortie. Par conséquent, le code d’une application basée sur l’IA devient rapidement beaucoup plus complexe que de simples appels à l’API de chat du modèle. Au minimum, les développeurs devront ajouter au moins une couche de diffusion des données, qui inclut des appels à des bases de données spécialisées afin de construire le contexte qui sera présenté au modèle.

Mais la complexité ne s’arrête pas là. À mesure que les développeurs ajoutent des fonctionnalités à leurs applications basées sur l’IA, ils constatent souvent que celles-ci nécessitent différents contextes et différents jeux d’invites. Les développeurs, naturellement attirés par les abstractions, organiseront donc le code qui alimente ces différentes fonctionnalités en modules autonomes. En IA, ce type de modèle de conception est appelé « agent ».

Agents, assemblez-vous : surmonter la complexité de l’IA générative

Un agent est un module de code qui utilise des modèles d’IA générative pour exécuter une tâche précise de manière autonome. Les agents peuvent agir seuls ou conjointement avec d’autres agents. Ils peuvent également appeler des « outils », généralement des API ou des fonctions incluses dans le contexte mis à leur disposition. Concrètement, cette approche agentique de la conception logicielle complexifie l’ingénierie du contexte, c’est-à-dire le processus qui consiste à récupérer les données pertinentes dont l’agent a besoin pour accomplir sa tâche. En outre, les agents eux-mêmes doivent souvent s’exécuter de manière asynchrone en dehors de l’application principale, en particulier lorsqu’ils doivent accéder à des données sensibles. Cela peut nécessiter de gérer des environnements d’exécution entièrement distincts, ainsi que des informations d’identification séparées.

Une application d’IA agentique classique peut être décomposée en plusieurs composants :

  1. Le modèle d’IA générative, qui comprend généralement un grand modèle de langage (LLM) et les API permettant d’y accéder.
  2. Les frameworks logiciels, qui fournissent des abstractions pratiques pour les API de modèles de plus bas niveau, ainsi que des kits de développement logiciel permettant de créer des agents et d’effectuer de nombreuses opérations d’accès aux données requises par l’ingénierie du contexte.
  3. Les composants de diffusion des données, qui fournissent les informations incluses dans le contexte transmis aux agents. Il peut s’agir de différents magasins de données (systèmes de gestion de bases de données relationnelles, bases de données NoSQL, etc.), mais ils incluent presque toujours une forme de service de recherche sémantique. Dans les applications agentiques, cette fonction est généralement déléguée à un magasin de vecteurs, qui stocke des représentations numériques de données textuelles appelées vectorisations.
  4. Un environnement d’exécution pour les agents. Pour les applications agentiques simples, les agents peuvent s’exécuter dans le même processus que le code de l’application. Mais, dans la plupart des cas, les agents devront s’exécuter dans leur propre espace de processus, isolés de l’application principale dans un environnement de test (sandbox).

Comme pour toute architecture logicielle qui exige la coordination de plusieurs composants, un volume important de tâches indifférenciées est nécessaire pour garantir la résilience, la redondance et les performances de ces composants. Heureusement, les applications d’IA agentique bénéficient des mêmes architectures natives cloud que les applications traditionnelles. Les architectures sans serveur sont particulièrement intéressantes pour les applications d’IA agentique, et AWS propose diverses offres sans serveur qui permettent aux développeurs de créer des applications d’IA agentique rapidement, facilement et à moindre coût.

L’inférence en action

Commençons par le composant le plus connu : les modèles d’IA générative eux-mêmes. On parle d’« inférence » pour désigner l’exécution de modèles. Pour l’inférence sans serveur, Amazon Bedrock fournit un service géré permettant d’exécuter des modèles de fondation d’IA générative et d’y accéder. Ces modèles vont des LLM dotés de connaissances frontières, comme Claude d’Anthropic, aux modèles vocaux comme Amazon Nova Sonic, en passant par les modèles à poids ouverts (« open-weight ») d’OpenAI et de Mistral, tous accessibles via une API unifiée.

Ensuite, l’inférence. Elle est généralement complexe et nécessite du matériel spécialisé comme des GPU, ainsi qu’une compréhension approfondie des frameworks réseau de bas niveau qui permettent aux clusters de GPU de communiquer entre eux. Cela a longtemps créé des difficultés opérationnelles et un obstacle à l’accessibilité, en particulier pour les start-ups. Amazon Bedrock aide à lever ces obstacles, car les utilisateurs ont seulement besoin d’apprendre à utiliser les API de la solution.

Vectorisation intelligente : bases de connaissances et magasins de vecteurs

Outre l’inférence et l’exécution de modèles, Amazon Bedrock prend également pleinement en charge les composants de diffusion des données les plus courants de la pile d’IA agentique. Les bases de connaissances Amazon Bedrock, par exemple, peuvent servir à la recherche sémantique, qui consiste à rechercher, dans un ensemble de documents, ceux qui sont sémantiquement proches du texte de la requête. C’est essentiel lorsqu’un agent d’IA a besoin d’informations supplémentaires dans son contexte.

Par exemple, un agent du service client peut avoir besoin de consulter des documents de FAQ correspondant aux informations demandées par le client, comme : « Comment modifier l’adresse associée à mon compte ? » Avec les bases de connaissances Amazon Bedrock, les documents de FAQ peuvent être indexés pour la recherche sémantique en les stockant dans un compartiment Amazon S3 et en configurant ce compartiment comme source de données pour une base de connaissances Bedrock. Le service gère le « découpage » des documents (division d’un document en parties plus petites), la « vectorisation » de chaque bloc (création des vectorisations numériques du texte), ainsi que le stockage et la mise en relation des blocs et des vectorisations afin que les blocs pertinents puissent être renvoyés dans une requête sémantique.

Une fois ces vectorisations créées, elles doivent être stockés dans une base de données spécialisée pour les vectorisations, ou magasin de vecteurs. Les bases de connaissances Amazon Bedrock prennent en charge plusieurs options de magasin de vecteurs, notamment Amazon S3 Vectors, une base de données vectorielles sans serveur intégrée à Amazon S3. Ce type de couche de diffusion des données correspond à la génération à enrichissement contextuel (RAG) et se met facilement en œuvre avec les bases de connaissances Amazon Bedrock, S3 et S3 Vectors. Les développeurs peuvent ainsi se concentrer sur les fonctionnalités de leurs agents d’IA plutôt que sur la gestion d’une infrastructure complexe de diffusion des données.

Création, exécution, mise à l’échelle

Une fois les vectorisations stockées et accessibles par l’intermédiaire de magasins de vecteurs, l’étape suivante consiste à exécuter les agents d’IA qui utilisent ces données. Amazon Bedrock AgentCore fournit aux développeurs un environnement d’exécution sans serveur. Les agents peuvent être créés avec des frameworks comme LangChain, Strands ou même une solution maison. Les développeurs peuvent ensuite compresser l’agent dans une archive ZIP et la charger dans S3. Ils peuvent également créer une image de conteneur et l’envoyer dans Amazon Elastic Container Registry (ECR). Une fois leur code dans S3 ou ECR, ils peuvent configurer AgentCore pour exécuter leur agent dans le cloud, sans avoir à gérer de serveurs. AgentCore gère également des processus opérationnels comme l’authentification, avec la prise en charge soit des rôles intégrés d’AWS Identity and Access Management, soit de la norme JSON Web Token pour la connexion via un fournisseur d’identité d’entreprise.

Amazon Bedrock et AgentCore offrent de nombreuses autres fonctionnalités sans serveur, mais les trois détaillées dans cet article constituent le point de départ idéal pour développer des applications d’IA agentique avec une prise en charge complète de la RAG. Tout d’abord, Amazon Bedrock pour l’inférence avec un large choix de modèles ; ensuite, les bases de connaissances Amazon Bedrock et S3 Vectors pour l’indexation de documents et la recherche sémantique ; enfin, Amazon AgentCore pour exécuter les agents de manière sécurisée et économique.

Le développement d’applications d’IA agentique a toujours été complexe et difficile, en particulier pour les start-ups, qui disposent souvent de ressources limitées. Les architectures sans serveur réduisent cette complexité en évitant aux ingénieurs de créer et de gérer l’infrastructure sous-jacente. Que vous soyez un développeur expérimenté en IA agentique ou que vous débutiez, Amazon Bedrock propose un ensemble complet d’outils et de services pour vous aider à créer et mettre à l’échelle en toute confiance.

Vous voulez commencer à créer de l’IA agentique sur AWS ? AWS Activate donne accès à des crédits AWS, qui peuvent servir à compenser le coût des solutions présentées dans cet article, ainsi que celui d’un large éventail d’autres services. Depuis sa création en 2013, AWS Activate a fourni plus de 8 milliards USD de crédits à des start-ups du monde entier. Les fondateurs bénéficient également de programmes et de ressources, d’un support technique, d’un mentorat métier et d’un lien plus étroit avec la communauté mondiale des start-ups. Rejoignez des millions d’autres utilisateurs et découvrez comment faire passer vos idées du concept à une solution prête pour le cloud.

Avez-vous trouvé les informations que vous recherchiez ?

Faites-nous part de vos commentaires afin que nous puissions améliorer le contenu de nos pages