AWS Infrastructure Sizing — Executive Summary

Sovereign LLM Workbench + LM Studio · User-tier procurement guide · v1.0 · June 2026

Purpose

Size AWS EC2 for local-sovereign AI (no cloud LLM APIs): FastAPI workbench + LM Studio SLM, RAG over internal documents, ChatGPT-like streaming UX on approved 7B models.

Experience targets

Tier summary (licensed users)

TierUsersArchitectureAWS (summary)Est. monthly*
T00–5Combined1× g5.xlarge or g4dn.xlarge$450–600
T16–10Splitg5.xlarge + m7i.large/xlarge$1.1–1.4K
T210–15Splitg5.xlarge + m7i.xlarge$1.3–1.7K
T315–25Split + 2 GPU2× g5.xlarge + m7i.2xlarge$2.4–3.8K
T425–50LLM pool2–3× g5.2xlarge or g5.48xlarge + c7i.2xlarge$5.5–9K+

*US on-demand EC2+EBS order-of-magnitude; excludes NAT/ALB/support.

Recommendation — 25 users, fast chat

Procure Tier T3 minimum: two GPU nodes for LM Studio (avoid single-GPU queueing), one m7i.2xlarge for Workbench/ChromaDB, 300 GB gp3, model google/gemma-3-1b, streaming enabled.

Do / Don't

DoDon't
Private VPC; LM Studio :1234 only from Workbench SGExpose LM Studio to 0.0.0.0/0
ALB + TLS + API_KEY / OIDCRun 25 users on one g5.xlarge
Approved catalog models onlyFrontier cloud APIs for regulated data

Windows first-time deploy

On-prem / EC2 Windows: run start-production.bat — installs deps, pulls LM Studio models, validates, starts server.