AWS 기술 블로그
Category: Amazon EC2
Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [2부: GPU 한 장의 처리량과 지연 SLO]
1부에서는 Amazon EKS의 GPU 노드에서 Gemma 4 31B를 vLLM으로 서빙할 때의 콜드 스타트를 다뤘습니다. 파드가 Ready가 되기까지의 시간을 428초에서 226초로 줄인 과정입니다. 스트리밍 로더로 가중치를 S3에서 직접 읽고 컴파일 캐시를 hostPath와 S3에 남기고 유휴 상태는 sleep/wake로 전환하는 구성이었습니다. 모델은 NVIDIA가 공개한 NVFP4 체크포인트 nvidia/Gemma-4-31B-IT-NVFP4입니다. 가중치 약 31GiB가 g7e.2xlarge의 96GB GPU 1개에 올라갑니다. 2부는 Ready 이후입니다. […]
Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [1부: 콜드 스타트 최적화]
Gemma 4는 Google이 공개한 오픈 웨이트 모델 패밀리로, E2B부터 31B까지 5가지 크기에 텍스트와 이미지 입력(E2B, E4B, 12B는 오디오도 지원), 최대 256K 토큰 컨텍스트(E2B, E4B는 128K), 추론(thinking) 모드를 제공합니다. 그중 31B는 밀집(dense) 구조의 최상위 모델로, NVFP4(4비트 부동소수점)로 양자화한 가중치 약 31GiB가 96GB GPU 1개에 올라가는 대신 시작할 때마다 수십 GB를 S3에서 GPU로 옮겨야 합니다. Amazon EKS에 […]
Amazon EC2 Nitro V6의 Connection Tracking 유휴 타임아웃 변경 대응하기
주말 내내 트래픽이 없던 서비스에서 월요일 아침 첫 요청들만 유독 타임아웃으로 실패합니다. Karpenter가 노드를 교체한 뒤부터는 원인을 알 수 없는 연결 오류가 늘었는데, 부하 테스트를 아무리 돌려도 재현되지 않습니다. 최근 이런 증상을 겪었다면 애플리케이션 코드보다 먼저 확인할 것이 있습니다. 워크로드를 실행 중인 인스턴스 타입의 세대와 Nitro 버전입니다. 2025년 6월부터 출시되고 있는 Nitro V6 기반 인스턴스(m8i, […]
분산 학습을 위한 AWS 컴퓨트 선택 가이드 (2편: 초대규모 스케일링과 인스턴스 확보)
1편에서는 모델 규모에 맞는 GPU 인스턴스와 인터커넥트, 병렬화 전략, 그리고 모델 메모리 계산까지 ‘무엇을 고를까’를 다뤘습니다. 이번 2편에서는 그 선택을 수천 장 규모로 확장합니다. 수천에서 수만 개의 GPU를 하나의 학습으로 묶는 울트라클러스터와 울트라서버 아키텍처, 그리고 이런 고성능 인스턴스를 실제로 확보하는 ODCR 및 Capacity Block 전략을 다룹니다. 시리즈 블로그 보기 분산 학습을 위한 AWS 컴퓨트 선택 […]
분산 학습을 위한 AWS 컴퓨트 선택 가이드 (1편: 모델 규모와 하드웨어 선택)
대규모 언어 모델(LLM) 학습을 준비하는 팀이 가장 먼저 부딪히는 질문은 결국 “어떤 GPU를 얼마나, 어떻게 확보할 것인가”로 귀결됩니다. 그러나 이 질문은 H100이냐 B200이냐를 고르는 단순한 하드웨어 선택으로 끝나지 않습니다. 하나의 노드로 충분한지, 아니면 여러 노드로 확장해야 하는지, On-Demand로 그때그때 띄울지, Capacity Block으로 미리 예약할지, 평범한 EC2 클러스터로 감당이 되는지, 아니면 Amazon EC2 울트라클러스터(UltraClusters)나 Amazon EC2 […]
스트라드비젼의 AWS 클라우드 기반 피지컬 AI End-to-End 파이프라인 가속화 사례
자동차가 스스로 주변상황을 인식하고 판단하려면, 수백, 수천만 장의 도로 이미지 데이터가 필요합니다. 그런데 만약 AI가 학습해야 할 상황이 현실에서는 거의 일어나지 않는 희귀한 장면이라면 어떨까요? 예를 들어, 사람이 차 바로 앞으로 뛰어드는 상황이나, 인도 도로 한복판에 소가 누워 있는 상황을 카메라로 찍어 모아야 한다면? 스트라드비젼은 자동차의 카메라가 세상을 보고 이해할 수 있게 하는 Vision AI […]
에잇퍼센트의 Kiro CLI 기반 Amazon ECS 현대화 여정
이 블로그는 에잇퍼센트와 AWS의 협업으로 작성되었습니다. 현업 운영을 병행하면서 2영업일 만에 레거시 서비스를 Amazon ECS로 전환하고, 월 운영 비용을 약 76% 절감할 수 있을까요? 에잇퍼센트는 AI 코딩 에이전트 Kiro CLI와 오픈소스 AI-Driven Modernization Prompt Sets를 결합해 이를 실현했습니다. 이번 글에서는 에잇퍼센트가 AWS Lift-On 프로그램의 지원을 받아, 소규모 백엔드 팀이 기능 개발과 장애 대응을 병행하면서도 Amazon […]
Amazon EC2 G5/G6 인스턴스에서 GPU Tensor Parallelism으로 비용 효과적으로 LLM 서빙하기
최근 많은 기업들이 자체 LLM을 구축하거나, 오픈소스 sLLM(Small Large Language Model)을 활용하여 설치형 LLM서비스를 구성하려는 수요가 크게 증가하고 있습니다. 그런데 실제로 배포하려는 모델을 살펴보면, Llama 3 70B, Qwen 72B, EXAONE 3.5 32B 등 모델을 GPU에 로드할 때 필요한 메모리가 40GB에서 최대 150GB에 달하는 경우가 많아, GPU 메모리가 80GB인 H100/H200이 탑재된 Amazon P5 인스턴스 이상을 요청하는 […]
Grafana k6로 Amazon EC2 비용 최적화 하기
들어가며 “우리 서비스에 어떤 EC2 인스턴스 타입을 써야 할까?” 클라우드 인프라를 운영하는 엔지니어라면 누구나 한 번쯤 마주치는 질문입니다. Amazon EC2는 700개가 넘는 인스턴스 타입을 제공하며, 각각 CPU 아키텍처와 세대, 메모리/네트워크 구성이 다릅니다. 스펙 시트에 적힌 vCPU 수와 메모리 용량만으로는 실제 워크로드에서의 성능을 예측하기 어렵습니다. 같은 8 vCPU라도 아키텍처(x86 vs ARM), 세대(5세대 vs 8세대), 워크로드 특성에 […]
Config의 Amazon EKS Spot 기반 대규모 RFM 데이터 파이프라인 구축
소개 Config는 General-Purpose Robot Foundation Model을 실현하기 위한 데이터 인프라와 기술을 구축하는 기업입니다. 다양한 실제 환경에서 로봇이 양손 조작 작업을 안정적으로 수행할 수 있도록, 대규모 학습 데이터의 수집부터 전처리, 모델 학습, 실환경 검증까지 이어지는 end-to-end 파이프라인을 운영하고 있습니다. 현재까지 약 10만 시간 규모의 액션 데이터를 구축했으며, 월 약 2만 시간의 데이터를 지속적으로 수집하고 있습니다. 이미지 […]







