LLMCost

RAG Pipeline LLM Cost

Retrieval-augmented generation over your documents. Monthly estimates at 30,000 requests/mo, avg 4,000 input / 500 output tokens per request.

#ModelEst. monthly costvs cheapest
1Qwen: Qwen3.7 Flash$5.55
2OpenAI: GPT-5 Nano$12.002.2×
3DeepSeek: DeepSeek V4 Flash 0731$12.302.2×
4Google: Gemini 2.5 Flash Lite$18.003.2×
5OpenAI: GPT-5.6 Luna Pro (batch)$21.003.8×
6OpenAI: GPT-5.6 Luna (batch)$21.003.8×
7Meta: Llama 4 Maverick$36.006.5×
8DeepSeek: DeepSeek V4 Flash Vision Exp$36.306.5×
9Google: Gemini 3.7 Flash (batch)$36.566.6×
10Google: Gemini 3.5 Flash Lite (batch)$36.756.6×
11OpenAI: GPT-5.6 Luna$42.007.6×
12OpenAI: GPT-5.6 Luna Pro$42.007.6×
13OpenAI: GPT-5.4 Nano$42.757.7×
14Google: Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image)$52.509.5×
15Qwen: Qwen3.7 Plus$57.6010.4×
16OpenAI: GPT-5 Mini$60.0010.8×
17Google: Gemini 3.7 Flash$73.1313.2×
18Google: Gemini 3.6 Flash (batch)$73.1313.2×
19Google: Gemini 3.5 Flash Lite$73.5013.2×
20Google: Gemini 2.5 Flash$73.5013.2×
21Qwen: Qwen3 235B A22B$81.9014.8×
22DeepSeek: DeepSeek V3.1$90.7516.4×
23Qwen: Qwen3.8 27B$93.0016.8×
24Google: Nano Banana 2 (Gemini 3.1 Flash Image)$105.0018.9×
25DeepSeek: R1$121.5021.9×
26Amazon: Nova Pro 1.0$144.0025.9×
27Google: Gemini 3.6 Flash$146.2526.4×
28OpenAI: GPT-5.4 Mini$157.5028.4×
29DeepSeek: DeepSeek V4 Pro 0813$185.1333.4×
30OpenAI: GPT-5.6 Sol Pro (batch)$195.0035.1×
31OpenAI: GPT-5.6 Sol (batch)$195.0035.1×
32Anthropic: Claude Sonnet 5 (batch)$195.0035.1×
33OpenAI: o4 Mini$198.0035.7×
34OpenAI: GPT-5.6 Terra Pro (batch)$210.0037.8×
35OpenAI: GPT-5.6 Terra (batch)$210.0037.8×
36OpenAI: GPT-5$300.0054.1×
37Google: Gemini 2.5 Pro$300.0054.1×
38Google: Gemini 3.5 Flash$315.0056.8×
39Qwen: Qwen3.8 2.4T A95B$330.0059.5×
40SpaceXAI: Grok 4.6$330.0059.5×
41Qwen: Qwen3.8 Max$330.0059.5×
42SpaceXAI: Grok 4.5$330.0059.5×
43OpenAI: o3$360.0064.9×
44OpenAI: GPT-5.6 Sol$390.0070.3×
45Anthropic: Claude Sonnet 5$390.0070.3×
46OpenAI: GPT-5.6 Sol Pro$390.0070.3×
47OpenAI: GPT-5.6 Terra Pro$420.0075.7×
48OpenAI: GPT-5.6 Terra$420.0075.7×
49Google: Nano Banana Pro (Gemini 3 Pro Image)$420.0075.7×
50Claude Opus 5 (batch)$487.5087.8×
51Anthropic: Claude Opus 4.8 (batch)$487.5087.8×
52OpenAI: GPT-5.4$525.0094.6×
53Anthropic: Claude Sonnet 4.5$585.00105.4×
54Claude Opus 5$975.00175.7×
55Anthropic: Claude Fable 5 (batch)$975.00175.7×
56Anthropic: Claude Opus 4.8$975.00175.7×
57OpenAI: GPT-5.5$1050.00189.2×
58Anthropic: Claude Fable 5$1950.00351.4×
59Claude Opus 5 (Fast)$1950.00351.4×
60Anthropic: Claude Opus 4.8 (Fast)$1950.00351.4×
61Anthropic: Claude Opus 4.1$2925.00527.0×
62OpenAI: GPT-5 Pro$3600.00648.6×
63OpenAI: GPT-5.5 Pro$6300.001135.1×

Cost-saving tips for rag pipelines

  • High request volume × large input = budget models shine. Quality delta is often negligible.
  • Deduplicate retrieved chunks before sending to the model.
  • Consider smaller chunks + top-3 retrieval instead of top-10 to cut input tokens by half.

Customize the numbers with the interactive calculator · All scenarios