Sovereign LLM Workbench + LM Studio · User-tier procurement guide · v1.0 · June 2026
Size AWS EC2 for local-sovereign AI (no cloud LLM APIs): FastAPI workbench + LM Studio SLM, RAG over internal documents, ChatGPT-like streaming UX on approved 7B models.
| Tier | Users | Architecture | AWS (summary) | Est. monthly* |
|---|---|---|---|---|
| T0 | 0–5 | Combined | 1× g5.xlarge or g4dn.xlarge | $450–600 |
| T1 | 6–10 | Split | g5.xlarge + m7i.large/xlarge | $1.1–1.4K |
| T2 | 10–15 | Split | g5.xlarge + m7i.xlarge | $1.3–1.7K |
| T3 | 15–25 | Split + 2 GPU | 2× g5.xlarge + m7i.2xlarge | $2.4–3.8K |
| T4 | 25–50 | LLM pool | 2–3× g5.2xlarge or g5.48xlarge + c7i.2xlarge | $5.5–9K+ |
*US on-demand EC2+EBS order-of-magnitude; excludes NAT/ALB/support.
Procure Tier T3 minimum: two GPU nodes for LM Studio (avoid single-GPU queueing), one m7i.2xlarge for Workbench/ChromaDB, 300 GB gp3, model google/gemma-3-1b, streaming enabled.
| Do | Don't |
|---|---|
| Private VPC; LM Studio :1234 only from Workbench SG | Expose LM Studio to 0.0.0.0/0 |
| ALB + TLS + API_KEY / OIDC | Run 25 users on one g5.xlarge |
| Approved catalog models only | Frontier cloud APIs for regulated data |
On-prem / EC2 Windows: run start-production.bat — installs deps, pulls LM Studio models, validates, starts server.