接入文档

面向制造业的国产大模型统一接入与智能治理网关。本文档说明如何以最小改造成本将业务系统接入统一网关。

1. 概述

一个端点,纳管全部已接入的国产大模型与私有化模型

业务侧只需将 base_url 指向本网关、使用平台下发的 sk-safe- 前缀密钥,即可通过统一接口调用全部已纳管的国产大模型与内网自建模型,无需管理各厂商的账号与凭据。 网关在服务端完成智能路由、故障转移、限流配额、成本核算与全链路审计,业务代码零改造切换底层模型。

2. 获取密钥

密钥由平台管理员在控制台创建并下发

请联系平台管理员,在控制台「密钥与租户」页面为对应业务租户创建 API 密钥。 出于安全考虑,密钥明文仅在创建时显示一次, 平台仅存储其哈希值,无法二次找回;请创建后立即妥善保存(建议存入企业密钥管理系统)。 若密钥遗失或疑似泄露,应立即在控制台吊销并重新创建。

3. OpenAI 兼容调用

标准 Chat Completions 协议,任何 OpenAI 生态 SDK / 框架均可直接使用

POST /v1/chat/completions 发起请求,鉴权使用 Authorization: Bearer 请求头。curl 示例:

curl https://your-gateway/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-safe-xxxxxxxxxxxxxxxx" \
  -d '{
    "model": "deepseek-chat",
    "messages": [
      { "role": "user", "content": "总结一下本周产线设备的报警日志要点" }
    ]
  }'

Python(openai 官方 SDK)示例,仅需替换 base_url

from openai import OpenAI

# base_url 指向网关的 /v1,其余用法与官方 SDK 完全一致
client = OpenAI(
    base_url="https://your-gateway/v1",
    api_key="sk-safe-xxxxxxxxxxxxxxxx",
)

resp = client.chat.completions.create(
    model="deepseek-chat",
    messages=[{"role": "user", "content": "生成一份注塑车间设备巡检要点清单"}],
)
print(resp.choices[0].message.content)

4. Anthropic 兼容调用 / Claude Code 直连

网关同时暴露 Anthropic Messages 协议端点,自动完成协议适配

POST /v1/messages 发起请求,鉴权使用 x-api-key 请求头,并携带 anthropic-version: 2023-06-01

curl https://your-gateway/v1/messages \
  -H "Content-Type: application/json" \
  -H "x-api-key: sk-safe-xxxxxxxxxxxxxxxx" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "glm-4.6",
    "max_tokens": 1024,
    "messages": [
      { "role": "user", "content": "分析这段设备振动数据的异常趋势" }
    ]
  }'

Claude Code 等 Anthropic 生态工具可直接将上游指向本网关,仅需设置两个环境变量:

# 将 Claude Code 的上游指向本网关,即可直连已纳管的国产模型
export ANTHROPIC_BASE_URL=https://your-gateway
export ANTHROPIC_AUTH_TOKEN=sk-safe-xxxxxxxxxxxxxxxx

claude

网关会自动将 Anthropic Messages 协议适配为 OpenAI 兼容协议后转发至国产模型上游, 工具调用、流式输出等能力按上游模型的实际支持情况透传,业务侧无需感知底层差异。

5. 可用模型

以下为平台当前注册的全部模型;实际可调用范围以密钥的模型白名单为准

模型 ID名称供应商类别
deepseek-chatDeepSeek-V3 通用对话DeepSeek 深度求索国产云
deepseek-reasonerDeepSeek-R1 推理DeepSeek 深度求索国产云
glm-4.6GLM-4.6 旗舰智谱 GLM国产云
glm-4.5-airGLM-4.5-Air 轻量智谱 GLM国产云
glm-4-plusGLM-4-Plus智谱 GLM国产云
embedding-3GLM Embedding-3智谱 GLM国产云
kimi-k2-0905-previewKimi K2月之暗面 Kimi国产云
moonshot-v1-128kMoonshot 128K 长文本月之暗面 Kimi国产云
qwen-maxQwen-Max 旗舰阿里通义千问国产云
qwen-plusQwen-Plus 均衡阿里通义千问国产云
qwen-turboQwen-Turbo 高速阿里通义千问国产云
text-embedding-v3通义 Embedding-v3阿里通义千问国产云
doubao-pro豆包 Pro字节豆包国产云
doubao-seed豆包 Seed字节豆包国产云
hunyuan-turbo混元 Turbo腾讯混元国产云
MiniMax-M1MiniMax-M1MiniMax国产云
step-2-16kStep-2阶跃星辰国产云
4.0Ultra星火 4.0 Ultra讯飞星火国产云
ernie-4.5-turbo-128k文心 4.5 Turbo百度文心国产云
ernie-4.0-8k文心 4.0百度文心国产云
Baichuan4-Turbo百川4-Turbo百川智能国产云
yi-lightningYi-Lightning零一万物 Yi国产云
yi-largeYi-Large零一万物 Yi国产云
SenseChat-5商汤 SenseChat-5商汤日日新国产云
SkyChat-3.0天工 SkyChat-3.0昆仑天工国产云
shanhai-turbo山海 Turbo云知声山海国产云
minicpm-4MiniCPM-4面壁 MiniCPM国产云
360gpt-pro360智脑 Pro360 智脑国产云
gpt-4oGPT-4o 旗舰OpenAI国产云
gpt-4o-miniGPT-4o mini 低成本OpenAI国产云
o3o3 推理OpenAI国产云
o4-minio4-mini 推理轻量OpenAI国产云
text-embedding-3-largeEmbedding-3-largeOpenAI国产云
qwen2.5-72b-instructQwen2.5-72B(自建)内网 vLLM私有化
deepseek-r1-distill-32bDeepSeek-R1-Distill-32B(自建)内网 vLLM私有化
llama-3.3-70b-instructLlama-3.3-70B(自建)内网 vLLM私有化
chatglm3-6bChatGLM3-6B(自建)内网 vLLM私有化
qwen2.5-32b-instructQwen2.5-32B(Xinference)内网 Xinference私有化
qwen2.5:14bQwen2.5-14B(边缘)内网 Ollama私有化

6. 流式输出

SSE 流式返回,降低首字延迟

在请求体中加入 "stream": true,网关即以 Server-Sent Events(SSE)形式逐段返回内容,OpenAI 与 Anthropic 两种协议端点均支持。

{
  "model": "deepseek-chat",
  "stream": true,
  "messages": [
    { "role": "user", "content": "逐条解读这份工艺变更单" }
  ]
}

7. 私有化部署

全栈可离网自建,数据不出厂

平台支持将厂内 GPU 集群部署的 vLLM 服务与产线边缘侧的 Ollama 服务统一纳管, 与云端国产模型共用同一套鉴权、路由与审计体系。所有上游凭据经 AES-256-GCM 加密后落库, 明文密钥不出服务端。整套网关可在内网完全离网自建运行,满足信创与数据不出厂的合规要求。 私有化部署方案请联系平台管理员评估。