O blog da AWS

Como a Ânima reduziu 99% do custo do seu vector store com Amazon S3 Vectors

Por Wembley Carvalho e Mateus Pereira, Arquitetos de Soluções AWS Brasil e Thiago Prestes VSM Plataforma Acadêmica Ânima Educação.

Este post descreve como a Ânima Educação migrou o vector store do seu assistente de IA (IA.RA) de Amazon OpenSearch Serverless para Amazon S3 Vectors, reduzindo o custo mensal de aprox. US$ 30.000 para cerca de US$ 200, uma economia de 99%. Apresentamos a metodologia de validação (1.000 perguntas reais de alunos para latência e 500 para qualidade), os resultados de latência e qualidade, e as considerações aplicáveis a cenários semelhantes de custo em aplicações RAG.

Sobre a Ânima Educação

A Ânima Educação é um dos maiores ecossistemas de ensino superior privado do Brasil, com mais de 400 mil alunos distribuídos em diversas instituições. Seu braço de inovação investe continuamente em tecnologia educacional aplicada à experiência acadêmica. Para conseguir levar seu assistente de IA a todo o conteúdo acadêmico, a Ânima Educação precisou repensar o custo do seu vector store.

O assistente IA.RA e a arquitetura RAG

A IA.RA é a assistente de estudos integrada ao ecossistema Ulife. Ela usa o conteúdo das Unidades Curriculares (UCs) com o material didático oficial, para gerar respostas contextualizadas às dúvidas dos alunos.

A arquitetura segue o padrão Retrieval-Augmented Generation (RAG) sobre o Amazon Bedrock Knowledge Bases:

  • O conteúdo das UCs é indexado como embeddings em um vector store.
  • Quando o aluno faz uma pergunta, o sistema recupera os trechos mais relevantes (retrieve).
  • Um modelo de linguagem (LLM) sintetiza a resposta final a partir dos trechos recuperados.

A qualidade do retrieve influencia diretamente a fidelidade da resposta, o que torna a escolha do vector store um fator determinante.

Contexto: o custo como restrição à escala

O vector store original era o OpenSearch Serverless. Entregava boa qualidade e baixa latência, mas o custo crescia de forma incompatível com o objetivo de indexar todo o conteúdo acadêmico da Ânima.

Em setembro de 2025, a IA.RA operava com 30 UCs indexadas, a um custo de aproximadamente US$ 250/mês no OpenSearch Serverless. O roadmap, porém, previa o aumento para 821 Unidades Curriculares, totalizando mais de 100 GB de documentos.

No OpenSearch Serverless, o custo de vector search é dominado pelo compute, não pelo armazenamento. O algoritmo HNSW (Hierarchical Navigable Small World) é usado para busca aproximada de vizinhos mais próximos. Para manter baixa latência, ele exige que o índice vetorial resida em memória RAM. Conforme o volume de vetores cresce, mais OCUs (OpenSearch Compute Units) são necessárias. Além disso, cada vetor é armazenado em múltiplas estruturas internas: grafo HNSW, vector values e campo _source. Réplicas para alta disponibilidade multiplicam ainda mais a demanda por recursos.

A projeção para o cenário completo alcançava aprox. US$ 30.000/mês, valor acima do orçamento previsto para o projeto. Em paralelo, uma estimativa comparativa para um cenário de referência já evidenciava a disparidade:

Vector Store Custo mensal estimado
Amazon OpenSearch Serverless US$ 170–260
Amazon S3 Vectors US$ 10–15

Nota sobre os valores de custo: os custos citados neste post são estimativas baseadas na AWS Pricing Calculator e na fatura de produção da Ânima. Os preços podem variar conforme a região da AWS e o contrato comercial de cada cliente.

A economia potencial era expressiva. A questão técnica central para a decisão era determinar se o S3 Vectors entregaria qualidade de retrieve equivalente à do OpenSearch Serverless.

A validação: POC com tráfego real

A validação foi conduzida com perguntas reais de alunos, em vez de benchmarks sintéticos, em parceria com a AWS, por meio de uma Proof of Concept (POC, ou prova de conceito, em português) formal entre setembro e outubro de 2025.

Metodologia da validação

O objetivo da POC foi responder a uma pergunta objetiva: trocar o vector store degrada a experiência do aluno? Para isolar essa variável, o desenho do teste manteve todo o restante do pipeline constante.

  • Ambiente controlado (só o vector store muda). Mesmo pipeline RAG, mesmo modelo de embedding e mesma estratégia de chunking nos dois lados. A única diferença entre o baseline e o candidato foi o vector store: OpenSearch Serverless (baseline) versus S3 Vectors. Isso garante que qualquer diferença observada seja atribuível ao retrieve, e não a outra parte do sistema.
  • Seleção das perguntas. As perguntas vieram de tráfego real de produção da IA.RA (dúvidas de alunos sobre as Ucs) e não de conjuntos sintéticos. Foram usadas 1.000 perguntas para o teste de latência e um subconjunto de 500 perguntas para a avaliação de qualidade.
  • Critério de equivalência. Cada resposta gerada via S3 Vectors foi comparada, pergunta a pergunta, à resposta do baseline OpenSearch e classificada em três rótulos: equivalente, parcialmente equivalente ou divergente.
  • Quem avaliou e como. A classificação foi feita por avaliaçãon assistida por LLM com revisão humana. Os casos rotulados como divergentes passaram por uma segunda rodada de avaliação, focada na qualidade da resposta final entregue ao aluno.
  • Rubrica de pontuação. Na reavaliação dos casos divergentes, cada par de respostas foi julgado como mesma qualidade final, S3 Vectors superior ou OpenSearch superior.

Qualidade das respostas (500 perguntas)

Cada resposta gerada via S3 Vectors foi comparada ao baseline do OpenSearch:

Resultado Percentual
Respostas equivalentes 47,8%
Parcialmente equivalentes 6,2%
Divergentes 46,0%

Os 46% de casos divergentes foram reavaliados quanto à qualidade da resposta final. Nessa análise:

Avaliação dos casos divergentes (230 perguntas) Percentual
Mesma qualidade final 83,6%
S3 Vectors superior 10,2%
OpenSearch superior 6,2%

Mesmo quando os trechos recuperados diferiam, a resposta final manteve o mesmo nível em 83,6% dos casos. Nos 16,4% restantes, o S3 Vectors apresentou qualidade superior em 10,2% dos casos, contra 6,2% do OpenSearch.

Latência do retrieve (1.000 perguntas)

Estatística S3 Vectors OpenSearch Serverless
Média 978 ms 677 ms
Mediana 900 ms 547 ms

O OpenSearch foi mais rápido em 80,6% dos testes, com vantagem média de cerca de 300 ms. Contudo, em um chat em que a geração do LLM consome tipicamente 3–8 segundos, essa diferença no retrieve é absorvida pela latência total, com impacto pouco perceptível na experiência do usuário.

Decisão e migração

Com base nos resultados da validação e na necessidade de viabilizar a escala, a Ânima optou pela adoção antecipada do serviço, ainda em outubro de 2025, antes mesmo do Amazon S3 Vectors atingir disponibilidade geral (GA).

A arquitetura da IA.RA permaneceu inalterada: o mesmo pipeline RAG, o mesmo modelo de embedding, a mesma estratégia de chunking. A única mudança foi o vector store: de OpenSearch Serverless para S3 Vectors. No Amazon Bedrock Knowledge Bases, essa troca é operacionalmente direta: atualiza-se a configuração do data source, e o framework cuida da reindexação automaticamente.

A migração foi progressiva (DEV, homologação e produção), sem interrupção para os alunos. Para a área acadêmica, o efeito decisivo não foi apenas o custo menor, mas o que ele tornou possível:

“A redução de custo não foi uma otimização incremental: foi o que desbloqueou a escala do projeto. Sem isso, a IA.RA permaneceria restrita a um subconjunto de Unidades Curriculares.” — Rodrigo Alves, Diretor de Design Curricular da Vice-Presidência Acadêmica, Ânima Educação

Resultados consolidados

Os números a seguir consolidam os resultados da POC, conforme a metodologia descrita acima:

Métrica OpenSearch Serverless (projetado) S3 Vectors (produção)
Custo mensal aprox. US$ 30.000 aprox. US$ 200
Qualidade do retrieve Baseline Validada como equivalente
Latência média aprox. 677 ms aprox. 979 ms
Redução de custo > 99%

Lições aprendidas

  • Validação com tráfego real. Benchmarks sintéticos não capturam a distribuição real de perguntas dos usuários. A POC com dados de produção fundamentou a decisão de migração.
  • Latência de retrieve e latência percebida são distintas. Em pipelines RAG, o tempo de geração do LLM domina a experiência; 300 ms adicionais no retrieve são imperceptíveis no fluxo completo.
  • Custo como fator de viabilidade do produto. A redução de custo desbloqueou a escala; sem esta, o projeto ficaria restrito a um subconjunto de disciplinas.
  • Velocidade de adoção importa. A Ânima adotou o S3 Vectors antes do GA porque a validação com dados reais deu confiança suficiente. Esperar pela disponibilidade geral teria adiado em meses a entrega de valor para os alunos.
  • S3 Vectors atende workloads RAG read-heavy com sensibilidade a custo. Para cenários que não exigem latência sub 100 ms no retrieve, oferece uma relação custo-benefício vantajosa.

Sobre o Amazon S3 Vectors

Com o Amazon S3 Vectors, você armazena e consulta embeddings vetoriais diretamente no Amazon S3, sem provisionar infraestrutura dedicada de busca vetorial. Integrado nativamente ao Amazon Bedrock Knowledge Bases, é indicado para workloads em que o custo por GB armazenado quanto o custo por consulta, precisa ser significativamente inferior ao de soluções tradicionais.

Considerações sobre adequação de workload

As considerações a seguir ajudam a decidir, em cenários de RAG sensíveis a custo como o da IA.RA, quando o S3 Vectors é adequado e quando o custo adicional do OpenSearch se justifica.

A adequação do Amazon S3 Vectors depende do perfil do workload. No caso da IA.RA, o padrão é de leitura intensiva, com tolerância a latência de retrieve na ordem de centenas de milissegundos e atualização pouco frequente do conteúdo, cenário para o qual o serviço é indicado.

O S3 Vectors é uma camada de armazenamento vetorial otimizada para custo, e não um substituto direto do Amazon OpenSearch Serverless em todos os casos. Para determinados requisitos, o OpenSearch Serverless permanece mais adequado:

Requisito do workload Justificativa técnica
Latência de retrieve inferior a 10 ms O S3 Vectors opera na faixa de cerca de100 ms (warm) a sub-segundo (cold), característica arquitetural do serviço.
Alta vazão sustentada (milhares de QPS) O S3 Vectors é otimizado para consultas menos frequentes; o OpenSearch atende throughput concorrente mais elevado.
Atualização frequente do corpus O S3 Vectors não dispõe de ingestão contínua em tempo quase real.
Busca híbrida (lexical e vetorial combinadas) O S3 Vectors realiza apenas busca por similaridade vetorial.
Filtros avançados e recursos analíticos O metadado filtrável do S3 Vectors é limitado em tamanho, o que restringe cenários analíticos mais complexos.
Ajuste fino de recall/ANN O S3 Vectors não expõe parâmetros de configuração do índice (HNSW, quantização).

Uso combinado com o OpenSearch

As duas soluções não são mutuamente exclusivas. O S3 Vectors e o OpenSearch podem também operar em conjunto, cobrindo pontos distintos da relação entre custo e latência. Um padrão possível é a arquitetura em camadas: o S3 Vectors como camada de baixo custo para o acervo completo de vetores, e o OpenSearch como camada de consulta para o tráfego sensível a latência ou que exija busca híbrida. Há integração nativa entre os serviços para esse tipo de composição.

Para o workload da IA.RA, o perfil de leitura intensiva tornou o S3 Vectors adequado de forma isolada. Para outros cenários, a arquitetura em camadas pode ser a opção mais indicada.

Próximos passos

Os recursos a seguir são um ponto de partida para replicar essa abordagem:

Para avaliar a adequação do S3 Vectors a um cenário específico, entre em contato com o Solutions Architect responsável ou acesse o AWS Contact Sales.

Sobre os Autores

Thiago Prestes de Moraes é Value Stream Manager na Ânima Educação, com mais de 20 anos de experiência em tecnologia para o setor educacional. Lidera squads de arquitetura, SRE, mobile e produtos de IA responsáveis pelo ecossistema digital que atende cerca de 400 mil alunos. Especialista em arquitetura de software e DevOps, atua em ambientes AWS na construção de soluções de IA generativa — como a IARA, camada conversacional da Ânima sobre o Amazon Bedrock — transformando a experiência digital do aluno em larga escala.
Wembley Carvalho é Arquiteto de Soluções Senior na AWS com foco no setor de Educação, onde apoia instituições em sua jornada de modernização tecnológica. Com mais de 20 anos de experiência em TI e certificado AWS desde 2016, se especializou nos temas de Segurança em Cloud e Inteligência Artificial.
Mateus Pereira é um Arquiteto de Soluções Sênior de Setor Público na AWS, atuando no segmento de Educação e membro gold do TFC de Storage da AWS. Sua experiência profissional anterior inclui desenvolvimento de software, arquitetura de aplicações em núvem com foco em virtualização, armazenamento e proteção de dados. Bacharel em Sistemas de Informação e MBA em Arquitetura de Soluções pela FIAP.

Agradecemos ao time de tecnologia da Ânima Educação pela parceria na validação e pela autorização para compartilhar esses resultados.