{
  "metadata": {
    "title": "AI Model Token Pricing & Inference Cost Database",
    "domain": "aipricecalc.com",
    "version": "1.0.0",
    "last_updated_utc": "2026-10-03T04:00:01.706340+00:00",
    "total_models": 23,
    "sources": [
      "Official Vendor Pricing APIs (OpenAI, Anthropic, Google, DeepSeek, Mistral, Meta)",
      "LiteLLM Open Source Pricing Standard (BerriAI)",
      "Groq & Together AI Public LPU/GPU Compute Rates"
    ]
  },
  "models": [
    {
      "slug": "text-embedding-3-small",
      "name": "Text Embedding 3 (Small)",
      "provider": "OpenAI",
      "category": "Embedding",
      "family": "Embeddings",
      "pricing": {
        "input_per_1m": 0.02,
        "output_per_1m": 0.0,
        "cached_input_per_1m": null,
        "blended_3to1_per_1m": 0.015,
        "batch_discount_pct": 50
      },
      "context_window": {
        "max_input_tokens": 8191,
        "max_output_tokens": 4096,
        "formatted_context": "8k"
      },
      "capabilities": {
        "supports_vision": false,
        "supports_function_calling": false,
        "supports_prompt_caching": false
      },
      "performance": {
        "mmlu_score": null,
        "latency_tier": "Ultra-Fast"
      },
      "best_for": "Vector search, semantic clustering, RAG index creation",
      "description": "High-efficiency 1536-dimension embedding model with native dimension reduction.",
      "cost_tier": "Ultra Low (<$0.50)"
    },
    {
      "slug": "llama-3-1-8b-groq",
      "name": "Llama 3.1 8B Instant (Groq)",
      "provider": "Groq (Meta)",
      "category": "Ultra-Fast / Low Cost",
      "family": "Llama 3.1",
      "pricing": {
        "input_per_1m": 0.05,
        "output_per_1m": 0.08,
        "cached_input_per_1m": null,
        "blended_3to1_per_1m": 0.0575,
        "batch_discount_pct": 0
      },
      "context_window": {
        "max_input_tokens": 128000,
        "max_output_tokens": 4096,
        "formatted_context": "128k"
      },
      "capabilities": {
        "supports_vision": false,
        "supports_function_calling": true,
        "supports_prompt_caching": false
      },
      "performance": {
        "mmlu_score": 73.0,
        "latency_tier": "Blazing (~550 t/s)"
      },
      "best_for": "Instant search indexing, real-time moderation, intent classification",
      "description": "Micro-footprint model hosted on LPU chips achieving 500+ tokens per second at near-zero cost.",
      "cost_tier": "Ultra Low (<$0.50)"
    },
    {
      "slug": "gemini-1-5-flash",
      "name": "Gemini 1.5 Flash",
      "provider": "Google",
      "category": "Fast / Lightweight",
      "family": "Gemini 1.5",
      "pricing": {
        "input_per_1m": 0.075,
        "output_per_1m": 0.3,
        "cached_input_per_1m": 0.01875,
        "blended_3to1_per_1m": 0.1312,
        "batch_discount_pct": 50
      },
      "context_window": {
        "max_input_tokens": 128000,
        "max_output_tokens": 4096,
        "formatted_context": "128k"
      },
      "capabilities": {
        "supports_vision": true,
        "supports_function_calling": true,
        "supports_prompt_caching": true
      },
      "performance": {
        "mmlu_score": 78.9,
        "latency_tier": "Ultra-Fast (~100 t/s)"
      },
      "best_for": "High-frequency API calls, audio processing, bulk document summarization",
      "description": "Lightweight model with 1M context window engineered for high speed and cost efficiency.",
      "cost_tier": "Ultra Low (<$0.50)"
    },
    {
      "slug": "gemini-2-0-flash",
      "name": "Gemini 2.0 Flash",
      "provider": "Google",
      "category": "Fast / Multimodal",
      "family": "Gemini 2.0",
      "pricing": {
        "input_per_1m": 0.1,
        "output_per_1m": 0.4,
        "cached_input_per_1m": 0.025,
        "blended_3to1_per_1m": 0.175,
        "batch_discount_pct": 50
      },
      "context_window": {
        "max_input_tokens": 128000,
        "max_output_tokens": 4096,
        "formatted_context": "128k"
      },
      "capabilities": {
        "supports_vision": true,
        "supports_function_calling": true,
        "supports_prompt_caching": true
      },
      "performance": {
        "mmlu_score": 84.6,
        "latency_tier": "Ultra-Fast (~110 t/s)"
      },
      "best_for": "Real-time multimodal voice/video streaming, low-latency agent loops",
      "description": "Next-gen multimodal workhorse with sub-second latency and 1M token context window.",
      "cost_tier": "Ultra Low (<$0.50)"
    },
    {
      "slug": "text-embedding-3-large",
      "name": "Text Embedding 3 (Large)",
      "provider": "OpenAI",
      "category": "Embedding",
      "family": "Embeddings",
      "pricing": {
        "input_per_1m": 0.13,
        "output_per_1m": 0.0,
        "cached_input_per_1m": null,
        "blended_3to1_per_1m": 0.0975,
        "batch_discount_pct": 50
      },
      "context_window": {
        "max_input_tokens": 8191,
        "max_output_tokens": 4096,
        "formatted_context": "8k"
      },
      "capabilities": {
        "supports_vision": false,
        "supports_function_calling": false,
        "supports_prompt_caching": false
      },
      "performance": {
        "mmlu_score": null,
        "latency_tier": "Fast"
      },
      "best_for": "Dense multilingual retrieval, legal/medical knowledge bases",
      "description": "State-of-the-art 3072-dimension vector embedding model.",
      "cost_tier": "Ultra Low (<$0.50)"
    },
    {
      "slug": "deepseek-v3",
      "name": "DeepSeek V3",
      "provider": "DeepSeek",
      "category": "Flagship / Open-Weights",
      "family": "DeepSeek",
      "pricing": {
        "input_per_1m": 0.14,
        "output_per_1m": 0.28,
        "cached_input_per_1m": 0.014,
        "blended_3to1_per_1m": 0.175,
        "batch_discount_pct": 0
      },
      "context_window": {
        "max_input_tokens": 131072,
        "max_output_tokens": 8192,
        "formatted_context": "131k"
      },
      "capabilities": {
        "supports_vision": false,
        "supports_function_calling": true,
        "supports_prompt_caching": true
      },
      "performance": {
        "mmlu_score": 88.5,
        "latency_tier": "Fast (~60 t/s)"
      },
      "best_for": "General LLM routing, high-scale automation, cost reduction vs OpenAI",
      "description": "671B MoE (37B active) open-weights powerhouse providing top-tier intelligence at disruptive pricing ($0.14/1M input).",
      "cost_tier": "Ultra Low (<$0.50)"
    },
    {
      "slug": "gpt-4o-mini",
      "name": "GPT-4o Mini",
      "provider": "OpenAI",
      "category": "Fast / Lightweight",
      "family": "GPT-4",
      "pricing": {
        "input_per_1m": 0.15,
        "output_per_1m": 0.6,
        "cached_input_per_1m": 0.075,
        "blended_3to1_per_1m": 0.2625,
        "batch_discount_pct": 50
      },
      "context_window": {
        "max_input_tokens": 128000,
        "max_output_tokens": 16384,
        "formatted_context": "128k"
      },
      "capabilities": {
        "supports_vision": true,
        "supports_function_calling": true,
        "supports_prompt_caching": true
      },
      "performance": {
        "mmlu_score": 82.0,
        "latency_tier": "Ultra-Fast (~85 t/s)"
      },
      "best_for": "High-volume classification, customer support bots, lightweight summarization",
      "description": "Ultra-affordable small model replacing GPT-3.5 Turbo with significantly superior reasoning and vision.",
      "cost_tier": "Ultra Low (<$0.50)"
    },
    {
      "slug": "codestral",
      "name": "Codestral 22B",
      "provider": "Mistral AI",
      "category": "Code Specialist",
      "family": "Mistral",
      "pricing": {
        "input_per_1m": 0.3,
        "output_per_1m": 0.9,
        "cached_input_per_1m": null,
        "blended_3to1_per_1m": 0.45,
        "batch_discount_pct": 0
      },
      "context_window": {
        "max_input_tokens": 128000,
        "max_output_tokens": 128000,
        "formatted_context": "128k"
      },
      "capabilities": {
        "supports_vision": false,
        "supports_function_calling": true,
        "supports_prompt_caching": false
      },
      "performance": {
        "mmlu_score": 81.1,
        "latency_tier": "Ultra-Fast (~80 t/s)"
      },
      "best_for": "Fill-in-the-middle code completion, automated unit tests, IDE integration",
      "description": "Open-weight coding specialist model fluent in 80+ programming languages.",
      "cost_tier": "Ultra Low (<$0.50)"
    },
    {
      "slug": "deepseek-r1",
      "name": "DeepSeek R1",
      "provider": "DeepSeek",
      "category": "Reasoning / Deep Thinking",
      "family": "DeepSeek",
      "pricing": {
        "input_per_1m": 0.55,
        "output_per_1m": 2.19,
        "cached_input_per_1m": 0.14,
        "blended_3to1_per_1m": 0.96,
        "batch_discount_pct": 0
      },
      "context_window": {
        "max_input_tokens": 131072,
        "max_output_tokens": 65536,
        "formatted_context": "131k"
      },
      "capabilities": {
        "supports_vision": false,
        "supports_function_calling": true,
        "supports_prompt_caching": true
      },
      "performance": {
        "mmlu_score": 90.8,
        "latency_tier": "Reasoning (~40 t/s)"
      },
      "best_for": "Math proofs, complex algorithmic coding, autonomous agent reasoning",
      "description": "Open-weights reasoning model utilizing large-scale reinforcement learning, matching OpenAI o1 at 95% lower cost.",
      "cost_tier": "Low ($0.50-$2.00)"
    },
    {
      "slug": "llama-3-3-70b-groq",
      "name": "Llama 3.3 70B (Groq LPU)",
      "provider": "Groq (Meta)",
      "category": "Ultra-Fast Open Weights",
      "family": "Llama 3.3",
      "pricing": {
        "input_per_1m": 0.59,
        "output_per_1m": 0.79,
        "cached_input_per_1m": null,
        "blended_3to1_per_1m": 0.64,
        "batch_discount_pct": 0
      },
      "context_window": {
        "max_input_tokens": 128000,
        "max_output_tokens": 4096,
        "formatted_context": "128k"
      },
      "capabilities": {
        "supports_vision": false,
        "supports_function_calling": true,
        "supports_prompt_caching": false
      },
      "performance": {
        "mmlu_score": 86.0,
        "latency_tier": "Instant (~280 t/s)"
      },
      "best_for": "Instantaneous interactive chatbots, real-time voice translation, low-latency tool agents",
      "description": "Meta's flagship 70B open model hosted on Groq LPUs delivering 280+ tokens per second.",
      "cost_tier": "Low ($0.50-$2.00)"
    },
    {
      "slug": "claude-3-5-haiku",
      "name": "Claude 3.5 Haiku",
      "provider": "Anthropic",
      "category": "Fast / Lightweight",
      "family": "Claude 3.5",
      "pricing": {
        "input_per_1m": 0.8,
        "output_per_1m": 4.0,
        "cached_input_per_1m": 0.08,
        "blended_3to1_per_1m": 1.6,
        "batch_discount_pct": 50
      },
      "context_window": {
        "max_input_tokens": 128000,
        "max_output_tokens": 4096,
        "formatted_context": "128k"
      },
      "capabilities": {
        "supports_vision": false,
        "supports_function_calling": true,
        "supports_prompt_caching": true
      },
      "performance": {
        "mmlu_score": 75.2,
        "latency_tier": "Ultra-Fast (~95 t/s)"
      },
      "best_for": "Real-time agents, code completion, fast document scanning",
      "description": "High-speed intelligence matching previous-generation flagship performance at a fraction of latency.",
      "cost_tier": "Low ($0.50-$2.00)"
    },
    {
      "slug": "o1-mini",
      "name": "OpenAI o1-mini",
      "provider": "OpenAI",
      "category": "Reasoning / Deep Thinking",
      "family": "o-Series",
      "pricing": {
        "input_per_1m": 1.1,
        "output_per_1m": 4.4,
        "cached_input_per_1m": 0.55,
        "blended_3to1_per_1m": 1.925,
        "batch_discount_pct": 50
      },
      "context_window": {
        "max_input_tokens": 128000,
        "max_output_tokens": 65536,
        "formatted_context": "128k"
      },
      "capabilities": {
        "supports_vision": false,
        "supports_function_calling": true,
        "supports_prompt_caching": true
      },
      "performance": {
        "mmlu_score": 85.2,
        "latency_tier": "Fast Reasoning (~55 t/s)"
      },
      "best_for": "STEM problem solving, code generation, algorithmic optimization",
      "description": "Fast and economical reasoning model optimized for coding and math without vision overhead.",
      "cost_tier": "Low ($0.50-$2.00)"
    },
    {
      "slug": "o3-mini",
      "name": "OpenAI o3-mini",
      "provider": "OpenAI",
      "category": "Reasoning / Deep Thinking",
      "family": "o-Series",
      "pricing": {
        "input_per_1m": 1.1,
        "output_per_1m": 4.4,
        "cached_input_per_1m": 0.55,
        "blended_3to1_per_1m": 1.925,
        "batch_discount_pct": 50
      },
      "context_window": {
        "max_input_tokens": 200000,
        "max_output_tokens": 100000,
        "formatted_context": "200k"
      },
      "capabilities": {
        "supports_vision": false,
        "supports_function_calling": true,
        "supports_prompt_caching": true
      },
      "performance": {
        "mmlu_score": 89.5,
        "latency_tier": "Fast Reasoning (~60 t/s)"
      },
      "best_for": "High-throughput complex code synthesis and mathematical logic",
      "description": "Next-generation cost-efficient reasoning model with adjustable reasoning effort levels.",
      "cost_tier": "Low ($0.50-$2.00)"
    },
    {
      "slug": "gemini-1-5-pro",
      "name": "Gemini 1.5 Pro",
      "provider": "Google",
      "category": "Large Context (2M)",
      "family": "Gemini 1.5",
      "pricing": {
        "input_per_1m": 1.25,
        "output_per_1m": 5.0,
        "cached_input_per_1m": 0.3125,
        "blended_3to1_per_1m": 2.1875,
        "batch_discount_pct": 50
      },
      "context_window": {
        "max_input_tokens": 128000,
        "max_output_tokens": 4096,
        "formatted_context": "128k"
      },
      "capabilities": {
        "supports_vision": true,
        "supports_function_calling": true,
        "supports_prompt_caching": true
      },
      "performance": {
        "mmlu_score": 85.9,
        "latency_tier": "Standard (~35 t/s)"
      },
      "best_for": "Massive codebase analysis, hours of video comprehension, full book translation",
      "description": "Industry-record 2 Million token context window model with exceptional needle-in-a-haystack recall.",
      "cost_tier": "Low ($0.50-$2.00)"
    },
    {
      "slug": "mistral-large-2",
      "name": "Mistral Large 2",
      "provider": "Mistral AI",
      "category": "Flagship (EU Sovereign)",
      "family": "Mistral",
      "pricing": {
        "input_per_1m": 2.0,
        "output_per_1m": 6.0,
        "cached_input_per_1m": null,
        "blended_3to1_per_1m": 3.0,
        "batch_discount_pct": 0
      },
      "context_window": {
        "max_input_tokens": 262144,
        "max_output_tokens": 262144,
        "formatted_context": "262k"
      },
      "capabilities": {
        "supports_vision": false,
        "supports_function_calling": true,
        "supports_prompt_caching": false
      },
      "performance": {
        "mmlu_score": 84.0,
        "latency_tier": "Fast (~45 t/s)"
      },
      "best_for": "Multilingual EU business workflows, code generation, reasoning",
      "description": "European flagship 123B model with native multilingual fluency (FR, DE, ES, IT, AR, HI, JA, ZH).",
      "cost_tier": "Low ($0.50-$2.00)"
    },
    {
      "slug": "grok-2",
      "name": "Grok 2",
      "provider": "xAI",
      "category": "Flagship",
      "family": "Grok",
      "pricing": {
        "input_per_1m": 2.0,
        "output_per_1m": 10.0,
        "cached_input_per_1m": null,
        "blended_3to1_per_1m": 4.0,
        "batch_discount_pct": 0
      },
      "context_window": {
        "max_input_tokens": 131072,
        "max_output_tokens": 4000,
        "formatted_context": "131k"
      },
      "capabilities": {
        "supports_vision": true,
        "supports_function_calling": true,
        "supports_prompt_caching": false
      },
      "performance": {
        "mmlu_score": 87.5,
        "latency_tier": "Fast (~45 t/s)"
      },
      "best_for": "Real-time news synthesis, coding, uncensored creative reasoning",
      "description": "xAI's frontier model combining multimodal understanding with live knowledge access.",
      "cost_tier": "Low ($0.50-$2.00)"
    },
    {
      "slug": "gpt-4o",
      "name": "GPT-4o (Omni)",
      "provider": "OpenAI",
      "category": "Flagship",
      "family": "GPT-4",
      "pricing": {
        "input_per_1m": 2.5,
        "output_per_1m": 10.0,
        "cached_input_per_1m": 1.25,
        "blended_3to1_per_1m": 4.375,
        "batch_discount_pct": 50
      },
      "context_window": {
        "max_input_tokens": 128000,
        "max_output_tokens": 16384,
        "formatted_context": "128k"
      },
      "capabilities": {
        "supports_vision": true,
        "supports_function_calling": true,
        "supports_prompt_caching": true
      },
      "performance": {
        "mmlu_score": 88.7,
        "latency_tier": "Fast (~45 t/s)"
      },
      "best_for": "Complex enterprise workflows, high-precision coding, multi-modal analysis",
      "description": "OpenAI's flagship versatile multimodal model with native audio, vision, and fast reasoning capabilities.",
      "cost_tier": "Mid ($2.00-$5.00)"
    },
    {
      "slug": "command-r-plus",
      "name": "Command R+",
      "provider": "Cohere",
      "category": "Enterprise RAG Specialist",
      "family": "Command",
      "pricing": {
        "input_per_1m": 2.5,
        "output_per_1m": 10.0,
        "cached_input_per_1m": null,
        "blended_3to1_per_1m": 4.375,
        "batch_discount_pct": 0
      },
      "context_window": {
        "max_input_tokens": 128000,
        "max_output_tokens": 4096,
        "formatted_context": "128k"
      },
      "capabilities": {
        "supports_vision": false,
        "supports_function_calling": true,
        "supports_prompt_caching": false
      },
      "performance": {
        "mmlu_score": 75.7,
        "latency_tier": "Fast (~40 t/s)"
      },
      "best_for": "Grounded RAG with citation generation, enterprise business tooling",
      "description": "104B parameter model built specifically for accurate retrieval-augmented generation and tool integration.",
      "cost_tier": "Mid ($2.00-$5.00)"
    },
    {
      "slug": "claude-3-5-sonnet",
      "name": "Claude 3.5 Sonnet (v2)",
      "provider": "Anthropic",
      "category": "Flagship",
      "family": "Claude 3.5",
      "pricing": {
        "input_per_1m": 3.0,
        "output_per_1m": 15.0,
        "cached_input_per_1m": 0.3,
        "blended_3to1_per_1m": 6.0,
        "batch_discount_pct": 50
      },
      "context_window": {
        "max_input_tokens": 200000,
        "max_output_tokens": 8192,
        "formatted_context": "200k"
      },
      "capabilities": {
        "supports_vision": true,
        "supports_function_calling": true,
        "supports_prompt_caching": true
      },
      "performance": {
        "mmlu_score": 88.3,
        "latency_tier": "Fast (~50 t/s)"
      },
      "best_for": "Autonomous coding, complex tool use, multi-step agent reasoning",
      "description": "Industry benchmark for software engineering, computer use and nuanced long-form comprehension.",
      "cost_tier": "Mid ($2.00-$5.00)"
    },
    {
      "slug": "llama-3-1-405b-together",
      "name": "Llama 3.1 405B (Together AI)",
      "provider": "Together AI (Meta)",
      "category": "Giant Open Weights",
      "family": "Llama 3.1",
      "pricing": {
        "input_per_1m": 3.5,
        "output_per_1m": 3.5,
        "cached_input_per_1m": null,
        "blended_3to1_per_1m": 3.5,
        "batch_discount_pct": 0
      },
      "context_window": {
        "max_input_tokens": 128000,
        "max_output_tokens": 4096,
        "formatted_context": "128k"
      },
      "capabilities": {
        "supports_vision": false,
        "supports_function_calling": true,
        "supports_prompt_caching": false
      },
      "performance": {
        "mmlu_score": 88.6,
        "latency_tier": "Standard (~30 t/s)"
      },
      "best_for": "Synthetic data generation, model distillation, enterprise on-premise benchmarking",
      "description": "The world's largest open-weights frontier model with 405 Billion parameters.",
      "cost_tier": "Mid ($2.00-$5.00)"
    },
    {
      "slug": "gpt-4-turbo",
      "name": "GPT-4 Turbo",
      "provider": "OpenAI",
      "category": "Flagship (Legacy)",
      "family": "GPT-4",
      "pricing": {
        "input_per_1m": 10.0,
        "output_per_1m": 30.0,
        "cached_input_per_1m": null,
        "blended_3to1_per_1m": 15.0,
        "batch_discount_pct": 50
      },
      "context_window": {
        "max_input_tokens": 128000,
        "max_output_tokens": 4096,
        "formatted_context": "128k"
      },
      "capabilities": {
        "supports_vision": true,
        "supports_function_calling": true,
        "supports_prompt_caching": false
      },
      "performance": {
        "mmlu_score": 86.4,
        "latency_tier": "Standard (~25 t/s)"
      },
      "best_for": "Legacy enterprise pipelines, large document analysis",
      "description": "Previous-gen flagship model with 128k context window and JSON mode.",
      "cost_tier": "High ($5.00+)"
    },
    {
      "slug": "o1",
      "name": "OpenAI o1",
      "provider": "OpenAI",
      "category": "Reasoning / Deep Thinking",
      "family": "o-Series",
      "pricing": {
        "input_per_1m": 15.0,
        "output_per_1m": 60.0,
        "cached_input_per_1m": 7.5,
        "blended_3to1_per_1m": 26.25,
        "batch_discount_pct": 50
      },
      "context_window": {
        "max_input_tokens": 200000,
        "max_output_tokens": 100000,
        "formatted_context": "200k"
      },
      "capabilities": {
        "supports_vision": true,
        "supports_function_calling": true,
        "supports_prompt_caching": true
      },
      "performance": {
        "mmlu_score": 92.3,
        "latency_tier": "Thoughtful (~30 t/s)"
      },
      "best_for": "PhD-level science, competitive programming, complex math and multi-step architecture planning",
      "description": "Advanced reasoning model using Chain-of-Thought reinforcement learning before responding.",
      "cost_tier": "High ($5.00+)"
    },
    {
      "slug": "claude-3-opus",
      "name": "Claude 3 Opus",
      "provider": "Anthropic",
      "category": "Deep Analysis",
      "family": "Claude 3",
      "pricing": {
        "input_per_1m": 15.0,
        "output_per_1m": 75.0,
        "cached_input_per_1m": 1.5,
        "blended_3to1_per_1m": 30.0,
        "batch_discount_pct": 50
      },
      "context_window": {
        "max_input_tokens": 128000,
        "max_output_tokens": 4096,
        "formatted_context": "128k"
      },
      "capabilities": {
        "supports_vision": true,
        "supports_function_calling": true,
        "supports_prompt_caching": true
      },
      "performance": {
        "mmlu_score": 86.8,
        "latency_tier": "Standard (~22 t/s)"
      },
      "best_for": "Deep academic research, philosophical analysis, complex multi-document synthesis",
      "description": "High-capacity reasoning engine renowned for nuanced prose and deep domain mastery.",
      "cost_tier": "High ($5.00+)"
    }
  ]
}