DEEPSEEK API SPECIFICATION 2026
DeepSeek API 开放平台指南
为全球工程师、学术机构与高可用业务系统提供原生长窗口大模型推理服务,基于创新的上下文硬盘感知缓存机制,重新定义大模型落地成本边界。
API 价格与计费标准 (Cache Aware)
平台采用上下文缓存命中计费,针对常见的多轮对话、系统级提示词或固定工程代码上下文,系统自动复用 KV Cache,调用成本直降 80%~90%。
| 模型规格 | 上下文窗口 | 缓存命中输入 (每百万 Tokens) | 未命中输入 (每百万 Tokens) | 生成输出 (每百万 Tokens) |
|---|---|---|---|---|
| DeepSeek-V3 (通用超强基座) | 128K Tokens | ¥ 0.14 元 | ¥ 2.00 元 | ¥ 8.00 元 |
| DeepSeek-R1 (深度强化思考) | 128K Tokens | ¥ 0.14 元 | ¥ 4.00 元 | ¥ 16.00 元 |
高并发异步拓扑与 Harness 评测
异步推理分发引擎
全球多活双节点调度,微秒级首字吐出。
Harness 形式化测试矩阵
包含数学自省、逻辑漏洞检验与代码沙箱。
Python 接入示例 (兼容标准 SDK)
完全兼容主流生态协议,生产环境无须变更既有调用架构,仅需替换 base_url 与 api_key 即可平滑运行:
client_request.py
REST API v1
from openai import OpenAI
client = OpenAI(
api_key="your_deepseek_api_key",
base_url="https://api.deepseek.com"
)
# 发起 DeepSeek-R1 深度思考流式调用
response = client.chat.completions.create(
model="deepseek-reasoner",
messages=[
{"role": "system", "content": "你是一位专注于分布式高并发架构与系统优化的资深技术专家。"},
{"role": "user", "content": "请详述基于滑动窗口与 Redis Sorted Set 的限流器在高并发场景下的无死锁保证。"}
],
stream=True
)
for chunk in response:
# 打印显式思维链推演内容
if hasattr(chunk.choices[0].delta, 'reasoning_content') and chunk.choices[0].delta.reasoning_content:
print(chunk.choices[0].delta.reasoning_content, end="", flush=True)
# 打印最终正文答案
if hasattr(chunk.choices[0].delta, 'content') and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
DeepSeek Harness 自动化评测规范
DeepSeek Harness 是一套专为强化学习与思维链推演模型设计的开源测试套件。它通过构建动态代码沙箱与形式化符号约束,精准度量模型在长程推理中的闭环可靠性。
run_harness.sh
Evaluation Suite
# 1. 获取开源评测套件
git clone https://github.com/deepseek-ai/deepseek-harness.git
cd deepseek-harness
# 2. 安装必要运行依赖
pip install -r requirements.txt
# 3. 运行形式化数学与代码沙箱基准测试
python -m harness.evaluate \
--model deepseek-reasoner \
--tasks aime2024,math500,swe-bench \
--output_dir ./reports
本地部署与轻量蒸馏 (Ollama / vLLM)
针对企业数据隔离与离线研发场景,DeepSeek 开源了 1.5B 到 70B 全系列蒸馏权重:
local_install.sh
Local Inference
# 针对个人工作站拉取并运行 32B 深度思考模型
ollama run deepseek-r1:32b
# 针对普通笔记本电脑轻量运行
ollama run deepseek-r1:7b
开放平台常见问答 (FAQ)
问:API 的默认并发限额与 QPS 是多少?
问:思维链推理产生的 Tokens 如何收费?