Pular para o conteúdo principal

AWS Startups

Crie agentes de IA que escalam: arquitetura sem servidor na AWS

18 de fevereiro de 2026

Criação de agentes de IA escaláveis sem servidor

 

A criação de software na era da IA generativa apresenta um paradoxo. Por um lado, os modelos de conhecimento de ponta se tornaram tão poderosos que criar uma versão inicial de um aplicativo com inteligência artificial pode envolver pouco mais do que chamar uma simples API de bate-papo (e ter um agente de codificação escrevendo a maior parte do código!). Por outro lado, o nível de precisão, desempenho e otimização de custos exigido por um aplicativo de IA de nível de produção geralmente envolve uma arquitetura técnica complexa.

Essa complexidade surge em parte porque os algoritmos generativos de IA são probabilísticos em vez de determinísticos. Para reduzir a variação na saída de um modelo e melhorar a confiabilidade, os desenvolvedores usam técnicas como fornecer exemplos da aparência de uma resposta “boa” ou incluir informações adicionais (“contexto”), que o modelo pode considerar ao gerar a saída. Como resultado, o código de um aplicativo baseado em IA rapidamente se torna muito mais complexo do que simples chamadas para a API de bate-papo do modelo. No mínimo, os desenvolvedores precisarão adicionar pelo menos uma camada de servidor de dados que inclua chamadas para bancos de dados especializados para construir o contexto que será mostrado ao modelo.

Mas a complexidade não para por aí. À medida que os desenvolvedores adicionam mais recursos aos seus aplicativos baseados em IA, eles geralmente descobrem que isso exige contextos diferentes e conjuntos diferentes de solicitações. Assim, os desenvolvedores, atraídos por abstrações, organizarão o código que alimenta esses diferentes recursos em módulos independentes. Na IA, esse tipo de padrão de design é conhecido como “agente”.

Agentes se reúnem: superando a complexidade na IA generativa

Um agente é um módulo de código que usa modelos generativos de IA para realizar uma tarefa específica de forma autônoma. Os agentes podem agir sozinhos ou em conjunto com outros agentes. Eles também podem chamar “ferramentas” que normalmente são APIs ou funções incluídas no contexto disponível para o agente. O resultado final dessa abordagem autêntica ao design de software é que a engenharia de contexto — o processo de buscar os dados relevantes de que um agente precisa para concluir sua tarefa — se torna mais complexa. Além disso, os próprios agentes geralmente precisam ser executados de forma assíncrona fora do aplicativo principal (isso é especialmente verdadeiro para agentes que precisam de acesso a dados confidenciais). Isso pode exigir o gerenciamento de ambientes de execução totalmente separados, bem como de credenciais.

Um aplicativo típico de IA agente pode ser dividido nos seguintes componentes:

  1. O modelo generativo de IA, que normalmente inclui um modelo de linguagem grande (LLM) e as APIs que fornecem acesso a ele.
  2. Estruturas de software, que fornecem abstrações convenientes para as APIs do modelo de nível inferior, e kits de desenvolvimento de software para criar agentes e realizar muitas das operações de acesso a dados necessárias para a engenharia de contexto.
  3. Componentes de serviço de dados, que fornecem as informações incluídas no contexto fornecido aos agentes. Eles podem consistir em uma variedade de armazenamentos de dados diferentes (sistemas de gerenciamento de banco de dados relacional, bancos de dados NoSQL etc.) , mas quase sempre incluirá alguma forma de serviço de busca semântica. Para aplicativos agentes, isso normalmente é transferido para um armazenamento vetorial, que armazena representações numéricas de dados de texto chamadas de incorporações.
  4. Um ambiente de execução para os agentes. Para aplicativos agentes simples, os agentes podem ser executados em andamento com o código do aplicativo. Mas, na maioria dos casos, os agentes precisarão ser executados em seu próprio espaço de processo, isolados do aplicativo principal.

Como acontece com todas as arquiteturas de software que exigem que vários componentes trabalhem juntos, é necessária uma quantidade substancial de trabalho pesado indiferenciado para garantir que esses componentes sejam resilientes, redundantes e tenham bom desempenho. Felizmente, os aplicativos de IA agente se beneficiam das mesmas arquiteturas nativas da nuvem que os aplicativos tradicionais. As arquiteturas sem servidor são particularmente atraentes para aplicativos de IA agente, e a AWS oferece uma variedade de ofertas sem servidor que permitem aos desenvolvedores criar aplicativos de IA agentes de forma rápida, fácil e econômica.

Inferência em ação

Vamos começar com o componente mais conhecido: os próprios modelos generativos de IA. O termo para servir modelos é “inferência” e, para inferência sem servidor, o Amazon Bedrock fornece um serviço gerenciado para executar e acessar modelos básicos de IA generativos. Eles variam de LLMs de conhecimento de fronteira, como Claude da Anthropic, a modelos baseados em fala, como o Amazon Nova Sonic, a modelos de peso aberto da OpenAI e da Mistral, todos os quais podem ser acessados por meio de uma API unificada.

Em seguida, inferência. Isso geralmente é complexo e requer hardware especializado, como GPUs, e um profundo conhecimento das estruturas de rede de baixo nível que permitem que clusters de GPUs se comuniquem entre si. Tradicionalmente, isso cria desafios operacionais e uma barreira à acessibilidade, especialmente para startups. O Amazon Bedrock ajuda a derrubar essas barreiras, pois os usuários só precisam aprender a usar as APIs da solução.

Incorporação inteligente: bases de conhecimento e lojas vetoriais

Além da inferência e do fornecimento de modelos, o Amazon Bedrock também tem suporte total para os componentes mais comuns de veiculação de dados na pilha de IA agente. As bases de conhecimento da Amazon Bedrock, por exemplo, podem ser usadas para pesquisa semântica, que envolve pesquisar uma coleção de documentos que são semanticamente semelhantes ao texto na consulta. Isso é fundamental nos casos em que um agente de IA precisa de informações adicionais em seu contexto.

Por exemplo, um agente de atendimento ao cliente pode precisar consultar documentos de perguntas frequentes que correspondam às informações que o cliente está solicitando, por exemplo 'Como altero o endereço associado à minha conta? ' Usando as bases de conhecimento da Amazon Bedrock, os documentos de perguntas frequentes podem ser indexados para pesquisa semântica armazenando-os em um bucket do Amazon S3 e configurando esse bucket como fonte de dados para uma base de conhecimento da Bedrock. O serviço lida com a 'fragmentação' dos documentos (dividindo um documento em partes menores), 'vetorizando' cada parte (criando as incorporações numéricas do texto) e armazenando e relacionando as partes e as incorporações umas às outras para que partes relevantes possam ser retornadas em uma consulta semântica.

Depois que essas incorporações são criadas, elas precisam ser armazenadas em um banco de dados especializado para incorporações ou armazenamento vetorial. As bases de conhecimento da Amazon Bedrock oferecem suporte a várias opções de armazenamento vetorial, incluindo Amazon S3 Vectors, um banco de dados vetoriais sem servidor incorporado ao Amazon S3. Esse tipo de camada de servidor de dados é conhecido como Retrieval Augmented Generation (RAG) e é fácil de implementar usando as bases de conhecimento da Amazon Bedrock, os vetores S3 e S3. Isso permite que os desenvolvedores se concentrem na funcionalidade de seus agentes de IA em vez de gerenciar uma infraestrutura complexa de fornecimento de dados.

Construindo, executando, escalando

Depois que os embeddings são armazenados e acessíveis por meio de armazenamentos vetoriais, a próxima etapa é executar agentes de IA que usam esses dados. O Amazon Bedrock AgentCore fornece um ambiente de execução sem servidor para desenvolvedores. Os agentes podem ser criados usando estruturas como LangChain, Strands ou até mesmo algo desenvolvido internamente. Os desenvolvedores podem então empacotar o agente em um arquivo zip e carregá-lo no S3. Como alternativa, eles podem criar uma imagem de contêiner e enviá-la para o Elastic Container Registry (ECR) da Amazon. Quando o código estiver no S3 ou no ECR, eles poderão configurar o AgentCore para executar seu agente na nuvem, sem precisar gerenciar servidores. O AgentCore também gerencia processos operacionais, como autenticação, oferecendo suporte a funções integradas de gerenciamento de identidade e acesso da AWS, ou ao JSON Web Token para login por meio de um provedor de identidade corporativa.

O Amazon Bedrock e o AgentCore oferecem muitos outros recursos sem servidor, mas os três detalhados neste artigo fornecem o ponto de partida ideal para o desenvolvimento de aplicativos de IA agentes com suporte total para RAG. Primeiro, o Amazon Bedrock para inferência com uma ampla seleção de modelos; segundo, as bases de conhecimento do Amazon Bedrock e os vetores do S3 para indexação de documentos e pesquisa semântica; e, finalmente, o Amazon AgentCore para executar agentes de forma segura e econômica.

O desenvolvimento de aplicativos de IA agentes tem sido tradicionalmente complexo e desafiador, especialmente para startups que geralmente operam com recursos limitados. As arquiteturas sem servidor reduzem essa complexidade eliminando a necessidade de engenheiros criarem e gerenciarem a infraestrutura subjacente. Se você é um desenvolvedor de IA experiente ou está apenas começando, o Amazon Bedrock fornece um conjunto abrangente de ferramentas e serviços para ajudá-lo a criar e escalar com confiança.

Pronto para começar a criar IA agente na AWS? O AWS Activate oferece acesso aos créditos da AWS que podem ser usados para compensar o custo das soluções abordadas neste artigo, bem como a uma ampla variedade de outros serviços. Desde sua criação em 2013, o AWS Activate forneceu mais de 8 bilhões de dólares em créditos para startups em todo o mundo. Os fundadores também se beneficiam de programas e recursos, suporte técnico, orientação de negócios e uma conexão mais próxima com a comunidade global de startups. Junte-se a milhões de outras pessoas e descubra como transformar suas ideias do conceito em prontas para a nuvem.

Você encontrou o que procurava hoje?

Ajude a melhorar a qualidade do conteúdo em nossas páginas