Use case

Best AI models for RAG

Good RAG models have long context (to fit retrieved chunks), low hallucination, and tool use for query refinement.

Top 25 models for retrieval-augmented generation

#ModelProviderContextInput price / 1MTier
1DeepSeek V4 Flash Latest~deepseek1.0M
Ultra context (1M+)
$0.08Budget
2DeepSeek: DeepSeek V4 Flash 0731DeepSeek1.0M
Ultra context (1M+)
$0.09Budget
3Google: Gemini 2.0 Flash LiteGoogle1.0M
Ultra context (1M+)
$0.07Budget
4Google: Gemini 2.5 Flash Lite (batch)Google1.0M
Ultra context (1M+)
$0.05Budget
5OpenAI: GPT-4.1 Nano (batch)OpenAI1.0M
Ultra context (1M+)
$0.05Budget
6Auto RouterOpenrouter2M
Ultra context (1M+)
$-1000000.00Budget
7Auto Router (Beta)Openrouter2M
Ultra context (1M+)
$-1000000.00Budget
8Qwen: Qwen3.5-FlashQwen1M
Ultra context (1M+)
$0.07Budget
9Qwen: Qwen3.6 Plus Preview (free)Qwen1M
Ultra context (1M+)
$0.00Budget
10Qwen: Qwen3.7 FlashQwen1M
Ultra context (1M+)
$0.03Budget
11Z.ai: GLM 5.2Z Ai1.0M
Ultra context (1M+)
$0.10Budget
12ByteDance Seed: Seed 1.6 FlashBytedance Seed262K
Long context (128K+)
$0.07Budget
13DeepSeek: DeepSeek V4 Flash 0423DeepSeek1.0M
Ultra context (1M+)
$0.14Budget
14DeepSeek: DeepSeek V4 ProDeepSeek1.0M
Ultra context (1M+)
$0.43Budget
15Google: Gemini 2.0 FlashGoogle1.0M
Ultra context (1M+)
$0.10Budget
16Google: Gemini 2.5 FlashGoogle1.0M
Ultra context (1M+)
$0.30Budget
17Google: Gemini 2.5 Flash (batch)Google1.0M
Ultra context (1M+)
$0.15Budget
18Google: Gemini 2.5 Flash LiteGoogle1.0M
Ultra context (1M+)
$0.10Budget
19Google: Gemini 2.5 Flash Lite Preview 09-2025Google1.0M
Ultra context (1M+)
$0.10Budget
20Google: Gemini 2.5 Pro (batch)Google1.0M
Ultra context (1M+)
$0.63Budget
21Google: Gemini 3 Flash PreviewGoogle1.0M
Ultra context (1M+)
$0.50Budget
22Google: Gemini 3 Flash Preview (batch)Google1.0M
Ultra context (1M+)
$0.25Budget
23Google: Gemini 3.1 Flash LiteGoogle1.0M
Ultra context (1M+)
$0.25Budget
24Google: Gemini 3.1 Flash Lite (batch)Google1.0M
Ultra context (1M+)
$0.13Budget
25Google: Gemini 3.1 Flash Lite PreviewGoogle1.0M
Ultra context (1M+)
$0.25Budget

Frequently asked questions

How big should the context window be for RAG?

32K is a comfortable minimum for typical knowledge-base RAG. 128K+ lets you include large source documents without summarization. 1M+ enables 'cache the whole codebase' patterns.

Related use cases