Use case

Best AI models for RAG

Good RAG models have long context (to fit retrieved chunks), low hallucination, and tool use for query refinement.

Top 25 models for retrieval-augmented generation

#ModelProviderContextInput price / 1MTier
1DeepSeek: DeepSeek V4 Flash 0423DeepSeek1.0M
Ultra context (1M+)
$0.09Budget
2DeepSeek: DeepSeek V4 Flash 0731DeepSeek1.3M
Ultra context (1M+)
$0.04Budget
3DeepSeek: DeepSeek V4 Flash 0731 (free)DeepSeek1.0M
Ultra context (1M+)
$0.00Budget
4Google: Gemini 2.0 Flash LiteGoogle1.0M
Ultra context (1M+)
$0.07Budget
5Google: Gemini 2.5 Flash Lite (batch)Google1.0M
Ultra context (1M+)
$0.05Budget
6MiniMax: MiniMax M3 (free)Minimax1.0M
Ultra context (1M+)
$0.00Budget
7OpenAI: GPT-4.1 Nano (batch)OpenAI1.0M
Ultra context (1M+)
$0.05Budget
8OpenAI: GPT-6 Luna (batch)OpenAI1.1M
Ultra context (1M+)
$0.05Budget
9OpenAI: GPT-6 Luna Pro (batch)OpenAI1.1M
Ultra context (1M+)
$0.05Budget
10Auto RouterOpenrouter2M
Ultra context (1M+)
$-1000000.00Budget
11Auto Router (Beta)Openrouter2M
Ultra context (1M+)
$-1000000.00Budget
12Qwen: Qwen3.5-FlashQwen1M
Ultra context (1M+)
$0.07Budget
13Qwen: Qwen3.6 Plus Preview (free)Qwen1M
Ultra context (1M+)
$0.00Budget
14Qwen: Qwen3.7 FlashQwen1M
Ultra context (1M+)
$0.03Budget
15Ox AlphaStealth1.0M
Ultra context (1M+)
$0.00Budget
16Z.ai: GLM 5.3 Flash (batch)Z Ai1.0M
Ultra context (1M+)
$0.06Budget
17ByteDance Seed: Seed 1.6 FlashBytedance Seed262K
Long context (128K+)
$0.07Budget
18DeepSeek: DeepSeek V4 Flash 0731 (batch)DeepSeek1.0M
Ultra context (1M+)
$0.11Budget
19DeepSeek: DeepSeek V4 Flash Vision ExpDeepSeek1.0M
Ultra context (1M+)
$0.22Budget
20DeepSeek: DeepSeek V4 Flash Vision Exp (batch)DeepSeek1.0M
Ultra context (1M+)
$0.11Budget
21DeepSeek: DeepSeek V4 Pro 0423DeepSeek1.0M
Ultra context (1M+)
$0.96Budget
22DeepSeek: DeepSeek V4 Pro 0813 (batch)DeepSeek1.0M
Ultra context (1M+)
$0.66Budget
23DeepSeek: DeepSeek V4.1 FlashDeepSeek1.0M
Ultra context (1M+)
$0.10Budget
24DeepSeek: DeepSeek V4.1 Flash (batch)DeepSeek1.0M
Ultra context (1M+)
$0.11Budget
25Dots Studio: Dots3-Note Preview (free)Dots Studio512K
Long context (128K+)
$0.00Budget

Frequently asked questions

How big should the context window be for RAG?

32K is a comfortable minimum for typical knowledge-base RAG. 128K+ lets you include large source documents without summarization. 1M+ enables 'cache the whole codebase' patterns.

Related use cases