DeepSeek DeepSeek OPEN API SPEC
DEEPSEEK API SPECIFICATION 2026

DeepSeek API 开放平台指南

为全球工程师、学术机构与高可用业务系统提供原生长窗口大模型推理服务,基于创新的上下文硬盘感知缓存机制,重新定义大模型落地成本边界。

API 价格与计费标准 (Cache Aware)

平台采用上下文缓存命中计费,针对常见的多轮对话、系统级提示词或固定工程代码上下文,系统自动复用 KV Cache,调用成本直降 80%~90%。

模型规格 上下文窗口 缓存命中输入 (每百万 Tokens) 未命中输入 (每百万 Tokens) 生成输出 (每百万 Tokens)
DeepSeek-V3 (通用超强基座) 128K Tokens ¥ 0.14 元 ¥ 2.00 元 ¥ 8.00 元
DeepSeek-R1 (深度强化思考) 128K Tokens ¥ 0.14 元 ¥ 4.00 元 ¥ 16.00 元

高并发异步拓扑与 Harness 评测

DeepSeek API 开放平台调用架构
异步推理分发引擎
全球多活双节点调度,微秒级首字吐出。
DeepSeek Harness 自动化测试
Harness 形式化测试矩阵
包含数学自省、逻辑漏洞检验与代码沙箱。

Python 接入示例 (兼容标准 SDK)

完全兼容主流生态协议,生产环境无须变更既有调用架构,仅需替换 base_url 与 api_key 即可平滑运行:

client_request.py REST API v1
from openai import OpenAI

client = OpenAI(
    api_key="your_deepseek_api_key",
    base_url="https://api.deepseek.com"
)

# 发起 DeepSeek-R1 深度思考流式调用
response = client.chat.completions.create(
    model="deepseek-reasoner",
    messages=[
        {"role": "system", "content": "你是一位专注于分布式高并发架构与系统优化的资深技术专家。"},
        {"role": "user", "content": "请详述基于滑动窗口与 Redis Sorted Set 的限流器在高并发场景下的无死锁保证。"}
    ],
    stream=True
)

for chunk in response:
    # 打印显式思维链推演内容
    if hasattr(chunk.choices[0].delta, 'reasoning_content') and chunk.choices[0].delta.reasoning_content:
        print(chunk.choices[0].delta.reasoning_content, end="", flush=True)
    # 打印最终正文答案
    if hasattr(chunk.choices[0].delta, 'content') and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

DeepSeek Harness 自动化评测规范

DeepSeek Harness 是一套专为强化学习与思维链推演模型设计的开源测试套件。它通过构建动态代码沙箱与形式化符号约束,精准度量模型在长程推理中的闭环可靠性。

run_harness.sh Evaluation Suite
# 1. 获取开源评测套件
git clone https://github.com/deepseek-ai/deepseek-harness.git
cd deepseek-harness

# 2. 安装必要运行依赖
pip install -r requirements.txt

# 3. 运行形式化数学与代码沙箱基准测试
python -m harness.evaluate \
  --model deepseek-reasoner \
  --tasks aime2024,math500,swe-bench \
  --output_dir ./reports

本地部署与轻量蒸馏 (Ollama / vLLM)

针对企业数据隔离与离线研发场景,DeepSeek 开源了 1.5B 到 70B 全系列蒸馏权重:

local_install.sh Local Inference
# 针对个人工作站拉取并运行 32B 深度思考模型
ollama run deepseek-r1:32b

# 针对普通笔记本电脑轻量运行
ollama run deepseek-r1:7b

开放平台常见问答 (FAQ)

问:API 的默认并发限额与 QPS 是多少?
答:注册企业开发者默认享有 60 QPS 弹性通道与 1,000,000 TPM 限额。对于更大体量的离线数据处理,可联系技术支持开辟专用算力集群通量。
问:思维链推理产生的 Tokens 如何收费?
答:模型深度思考输出的 Reasoning Tokens 与普通 Content Tokens 采用完全相同的费率标准,绝无任何额外加价或倍率计费。