Saltar al contenido principal

Startups de AWS

Creación de agentes de IA que escalan: arquitectura sin servidor en AWS

18 de febrero de 2026

Creación de agentes de IA escalables sin servidor

 

La creación de software en la era de la IA generativa presenta una paradoja. Por un lado, los modelos de conocimiento de vanguardia se han vuelto tan potentes que la creación de una versión inicial de una aplicación basada en IA puede implicar poco más que llamar a una simple API de chat (¡y hacer que un agente de codificación escriba la mayor parte del código!). Por otro lado, el nivel de precisión, rendimiento y optimización de costos requerido por una aplicación de IA de nivel de producción a menudo implica una arquitectura técnica compleja.

Esta complejidad se debe en parte a que los algoritmos de IA generativa son probabilísticos más que deterministas. Para reducir la varianza en la salida de un modelo y mejorar la fiabilidad, los desarrolladores utilizan técnicas como proporcionar ejemplos de cómo se ve una respuesta “buena” o incluir información adicional (“contexto”) que el modelo puede tener en cuenta al generar la salida. Como resultado, el código de una aplicación basada en IA se vuelve rápidamente mucho más complejo que las simples llamadas a la API de chat del modelo. Como mínimo, los desarrolladores deberán agregar al menos una capa de servicio de datos que incluya llamadas a bases de datos especializadas para establecer el contexto que se mostrará al modelo.

Pero la complejidad no termina ahí. A medida que los desarrolladores agregan más funciones a sus aplicaciones basadas en IA, suelen darse cuenta de que esto requiere contextos diferentes y conjuntos de prompts diferentes. Por lo tanto, los desarrolladores, que se sienten atraídos por las abstracciones, organizarán el código que impulsa estas diferentes capacidades en módulos autónomos. En la IA, este tipo de patrón de diseño se conoce como “agente”.

Los agentes se ensamblan: superación de la complejidad en la IA generativa

Un agente es un módulo de código que utiliza modelos de IA generativa para realizar una tarea específica de forma autónoma. Los agentes pueden actuar solos o en conjunto con otros agentes. También pueden llamar a “herramientas”, que suelen ser API o funciones que se incluyen en el contexto disponible para el agente. El resultado neto de este enfoque agéntico para el diseño de software es que la ingeniería de contexto (el proceso de obtener los datos relevantes que un agente necesita para completar su tarea) se vuelve más compleja. Además, los propios agentes suelen tener que ejecutarse de forma asincrónica fuera de la aplicación principal (esto es especialmente cierto en el caso de los agentes que requieren acceso a información confidencial). Esto puede requerir la administración de credenciales y tiempos de ejecución completamente independientes.

Una aplicación de IA agéntica típica se puede dividir en los siguientes componentes:

  1. El modelo de IA generativa, que normalmente incluye un modelo de lenguaje de gran tamaño (LLM) y las API que proporcionan acceso a él.
  2. Los marcos de software, que proporcionan abstracciones prácticas para las API de modelos de nivel inferior, y los kits de desarrollo de software para crear agentes y realizar muchas de las operaciones de acceso a los datos necesarias para la ingeniería de contexto.
  3. Componentes de servicio de datos, que proporcionan la información incluida en el contexto suministrado a los agentes. Estos pueden consistir en una variedad de almacenes de datos diferentes (sistemas de administración de bases de datos relacionales, bases de datos NoSQL, etc.) , pero casi siempre incluirán algún tipo de servicio de búsqueda semántica. En el caso de las aplicaciones agénticas, normalmente se descarga a un almacén vectorial, que almacena representaciones numéricas de datos de texto denominadas incrustaciones.
  4. Un tiempo de ejecución para los agentes. Para las aplicaciones agénticas simples, los agentes pueden ejecutarse en proceso con el código de la aplicación. Sin embargo, en la mayoría de los casos, los agentes deberán ejecutarse en su propio espacio de procesos, separados de la aplicación principal en un entorno de pruebas.

Como ocurre con todas las arquitecturas de software que requieren que varios componentes trabajen juntos, se requiere una cantidad considerable de trabajo pesado e indiferenciado para garantizar que estos componentes sean resilientes, redundantes y de alto rendimiento. Afortunadamente, las aplicaciones de IA agéntica se benefician de las mismas arquitecturas nativas en la nube que las aplicaciones tradicionales. Las arquitecturas sin servidor son particularmente atractivas para las aplicaciones de IA agéntica, y AWS ofrece una variedad de ofertas sin servidor que permiten a los desarrolladores crear aplicaciones de IA agéntica de manera rápida, fácil y rentable.

Inferencia en acción

Empecemos por el componente más conocido: los propios modelos de IA generativa. El término para el uso de modelos es “inferencia” y, para la inferencia sin servidor, Amazon Bedrock proporciona un servicio administrado para ejecutar modelos fundacionales de IA generativa y acceder a ellos. Estos van desde programas de LLM con conocimientos avanzados, como Claude, de Anthropic, hasta modelos basados en la voz, como Amazon Nova Sonic, y modelos abiertos de OpenAI y Mistral, a los que se puede acceder a través de una API unificada.

A continuación, la inferencia. Suele ser compleja y requiere hardware especializado como GPU y un conocimiento profundo de los marcos de red de bajo nivel que permiten que los clústeres de GPU se comuniquen entre sí. Tradicionalmente, esto ha creado desafíos operativos y una barrera de accesibilidad, especialmente para las startups. Amazon Bedrock ayuda a derribar estas barreras, ya que los usuarios solo tienen que aprender a usar las API de la solución.

Incrustaciones inteligentes: bases de conocimiento y almacenes vectoriales

Además del servicio de inferencias y modelos, Amazon Bedrock también es totalmente compatible con los componentes de servicio de datos más comunes de la pila de IA agéntica. Bases de conocimiento de Amazon Bedrock, por ejemplo, se puede usar para la búsqueda semántica, que implica buscar en una colección de documentos que son semánticamente similares al texto de la consulta. Esto es fundamental en los casos en los que un agente de IA necesita información adicional en su contexto.

Por ejemplo, un agente de servicio al cliente puede tener que consultar documentos de preguntas frecuentes que coincidan con la información que el cliente solicita, como, p. ej., “¿Cómo cambio la dirección asociada a mi cuenta?” Con Bases de conocimiento de Amazon Bedrock, los documentos de preguntas frecuentes se pueden indexar para la búsqueda semántica almacenándolos en un bucket de Amazon S3 y configurándolo como origen de datos para una base de conocimiento de Bedrock. El servicio se encarga de “fragmentar” los documentos (dividir un documento en partes más pequeñas), “vectorizar” cada fragmento (crear las incrustaciones numéricas del texto) y almacenar y relacionar los fragmentos y las incrustaciones entre sí para que los fragmentos relevantes puedan devolverse en una consulta semántica.

Una vez creadas estas incrustaciones, se tienen que almacenar en una base de datos especializada para incrustaciones o en un almacén vectorial. Bases de conocimiento de Amazon Bedrock admite varias opciones de almacenamiento vectorial, como Amazon S3 Vectors, una base de datos vectorial sin servidor integrada en Amazon S3. Este tipo de capa de servicio de datos se conoce como generación aumentada por recuperación (RAG) y es fácil de implementar con Bases de conocimiento de Amazon Bedrock, S3 y S3 Vectors. Esto permite que los desarrolladores se centren en la funcionalidad de sus agentes de IA en lugar de administrar una infraestructura compleja de servicio de datos.

Creación, ejecución y escalado

Una vez que las incrustaciones estén almacenadas y accesibles a través de almacenes vectoriales, el siguiente paso es ejecutar los agentes de IA que usen estos datos. Amazon Bedrock AgentCore proporciona un tiempo de ejecución sin servidor para los desarrolladores. Los agentes se pueden crear utilizando marcos como LangChain, Strands o incluso un sistema local. A continuación, los desarrolladores pueden empaquetar el agente en un archivo zip y cargarlo en S3. Como alternativa, pueden crear una imagen de contenedor y subirla a Amazon Elastic Container Registry (ECR). Una vez que su código esté en S3 o ECR, pueden configurar AgentCore para ejecutar su agente en la nube, sin necesidad de administrar servidores. AgentCore también gestiona los procesos operativos, como la autenticación, y admite roles integrados de AWS Identity and Access Management o JSON Web Token para iniciar sesión a través de un proveedor de identidades corporativo.

Amazon Bedrock y AgentCore ofrecen muchas más capacidades sin servidor, pero las tres que se detallan en este artículo proporcionan el punto de partida ideal para desarrollar aplicaciones de IA agéntica totalmente compatibles con RAG. En primer lugar, Amazon Bedrock para la inferencia con una amplia selección de modelos; en segundo lugar, Bases de conocimiento de Amazon Bedrock y S3 Vectors para la indexación de documentos y la búsqueda semántica; y, por último, Amazon AgentCore para ejecutar agentes de forma segura y rentable.

El desarrollo de aplicaciones de IA agéntica ha sido tradicionalmente complejo y desafiante, especialmente para las startups que a menudo operan con recursos limitados. Las arquitecturas sin servidor reducen esta complejidad al eliminar la necesidad de que los ingenieros creen y administren la infraestructura subyacente. Tanto si es un desarrollador de IA agéntica con experiencia como si acaba de empezar, Amazon Bedrock ofrece un conjunto completo de herramientas y servicios que le ayudarán a crear y escalar con confianza.

¿Tiene todo listo para empezar a crear IA agéntica en AWS? AWS Activate ofrece acceso a los créditos de AWS, que se pueden usar para compensar el costo de las soluciones que se describen en este artículo, así como a una amplia gama de otros servicios. Desde su creación en 2013, AWS Activate ha otorgado más de 8000 millones de dólares en créditos a startups de todo el mundo. Los fundadores también se benefician de los programas y recursos, la asistencia técnica, la tutoría empresarial y una conexión más estrecha con la comunidad global de startups. Únase a millones de personas y descubra cómo hacer que sus ideas pasen de ser conceptuales a estar listas para la nube.

¿Encontró lo que buscaba hoy?

Ayúdenos a mejorar la calidad del contenido de nuestras páginas compartiendo sus comentarios