CC 咖啡猫的工作空间 Coding Space

AI 中转站搭建实践

基于知乎文章《搭一个能稳定跑、给国内朋友拼车用的 AI 中转站》整理,原文发布于 2026-05-08。


整体架构

国内用户客户端
 → Cloudflare 边缘节点
 → CN2 专线回源到服务器
 → 宝塔 Nginx 反向代理
 → sub2api 程序
 → 号池(Claude / GPT / Gemini 网页账号)
 → 原厂返回数据 → 原路返回到客户端

三个核心组件:

组件 作用
CN2 GIA 服务器 运行环境,中国电信精品回国专线,国内访问最稳线路
sub2api 核心程序(开源),将 ChatGPT/Claude 网页账号 cookie/session 转成 OpenAI 兼容 API
Cloudflare 提速 + 隐藏服务器真实 IP,防攻击

为什么要自建中转站

第三方镜像站的风险

风险 说明
隐私泄露 所有对话内容经过第三方服务器,商业机密、敏感代码一览无余
性能不稳 用户多了就慢,高峰期经常卡死,影响工作效率
价格不透明 不知道实际成本,定价完全由镜像站说了算

自建的好处

  • 数据安全:所有接口请求只经过你自己的服务器,直连原厂 API
  • 性能可控:就几个人用,Max 200 刀套餐基本可以爽用 Opus
  • 成本透明:用了多少 token 一目了然,按官方价格换算具体费用
  • 监控完整:使用情况、成本分析、性能监控全都有

适合你的场景

  • 所在地区无法直接访问 Claude/GPT 服务
  • 担心第三方镜像站记录或泄露对话内容
  • 想和朋友一起分摊 Max 订阅费用
  • 有基本技术基础,愿意自己搭建和维护
  • 需要长期稳定访问,不想受制于镜像站

准备清单

  1. CN2 GIA 或 CN2 GT VPS(2C/2G/20GB 起步)
  2. 一个域名(.top/.xyz 几块钱一年即可)
  3. Cloudflare 账号(免费版够用)
  4. 号池(初期 Claude Code Pro x1 + 几个 GPT 账号)

坑点一:服务器必须 CN2

普通海外 VPS 走公网国际出口,晚高峰丢包率常超 30%,流式响应对延迟敏感,丢包就断流。

CN2 GIA 延迟一般在 150ms 以内,绕开拥堵公网节点。

主流服务商:

  • 搬瓦工(BandwagonHost):CN2 GIA-E 套餐稳定,价格略贵
  • dxclouds:聚合采购平台,支持按天计费、随时退款,新手友好

服务器初始化:宝塔面板

  1. 安装宝塔面板
  2. 防火墙放行 80、443、SSH 端口
  3. 域名加 A 记录指向服务器 IP
  4. 验证 DNS 生效:ping api.你的域名

部署 sub2api

# 1. 安装 Docker
curl -fsSL https://get.docker.com | bash

# 2. 拉取并启动 sub2api 容器

# 3. 号池数据放到 /www/sub2api/data 目录,容器监听本机 8080 端口

坑点二:Nginx 必须配流式响应

AI API 是 SSE(Server-Sent Events)流式响应,需要长连接 + 不缓存。

Nginx 默认开启 proxy_buffering,会把流式数据攒着一起吐 → 用户感觉"卡一阵 → 一次性砸出来",甚至超时报错。

关键配置项:

配置 作用
proxy_buffering off 关闭缓冲,逐字流式输出
proxy_read_timeout 300s 长连接超时,防止 AI 慢响应被切断
proxy_http_version 1.1 支持长连接

HTTPS 必须做

  • OpenAI 兼容客户端只信任 HTTPS
  • HTTP 明文传输暴露 API key,被嗅探后果严重
  • 宝塔 → SSL → Let's Encrypt → 申请免费证书 → 强制 HTTPS

坑点三:Cloudflare 的"优化"陷阱

Cloudflare 默认网页优化选项会破坏 AI API。

SSL 模式

Cloudflare → SSL/TLS → 概述 → 必须设为 Full (strict),其他模式不安全。

速度优化全部关闭

Cloudflare → 速度 → 优化,关闭:

  • Auto Minify:破坏流式响应
  • Rocket Loader:破坏 JS 加载
  • Mirage:图片优化,对 API 无意义
  • Polish:图片压缩,同上

缓存规则

  • Caching LevelBypass
  • 创建页面规则 api.你的域名/* → Cache Level = Bypass,不走缓存(否则不同用户拿到相同回答)

防火墙规则

规则 配置
单 IP 频率限制 IP source address,每 10 秒最多 30 次,超出挑战或屏蔽 1 小时
屏蔽恶意 UA User-Agent contains python-requests

进阶:Argo Smart Routing

  • Cloudflare 付费功能,约 $5/月
  • 国内用户访问海外服务器提速 30%~50%
  • 有付费用户群时值得开

号池运营

阶段 方案
初期 Claude Code Pro 单账号($20/月)+ 几个 GPT 账号,重点养号、稳定 IP、避免触发风控
中期 用量起来后找上游账号供应商,问清楚 OAuth 还是 cookie session
长期 Claude Code Max($100-200/月档),进阶玩法包括 Kiro 反代、AWS Bedrock 直连

号池本质是供应链管理,1 个 Pro 账号撑 3 人 vs 100 个 Pro 账号撑 2000 人,玩法完全不同。


测试验证

curl https://api.你的域名/v1/models \
  -H "Authorization: Bearer sk-你的key"

监控:宝塔面板自带监控看 CPU/内存/流量,深度需求上 Prometheus + Grafana。


Token 消耗与用量管理

为什么关心 token 消耗

自建中转站的核心优势之一就是每一笔消耗都透明。你可以:

  • 按 API Key 维度看每个人用了多少 token
  • 按账号维度看每个上游账号的消耗
  • 按时间维度看每日/每周趋势
  • 换算成实际费用,清晰分摊成本

用量统计维度

维度 说明
API Key 用量 每个 Key 的请求次数、token 消耗
账号用量 每个上游账号(Claude/GPT/Gemini)的消耗
模型用量 按模型区分(Opus/Sonnet/Haiku 等)
时间趋势 每日/每周使用量变化

成本控制手段

  • 速率限制:限制每个 API Key 在时间窗口内的请求次数和 Token 使用量
  • 并发限制:限制同时处理的请求数
  • 模型限制:限制可访问的模型列表(比如不让用 Opus,只能 Sonnet)
  • 客户端限制:限制只允许特定客户端使用(如只允许 Claude Code)

推荐方案

CRS(Claude Relay Service)的 Web 面板提供了完整的使用统计和成本分析。如果用的是 sub2api 方案,则需要自己对接 Prometheus + Grafana 做统计。


成本估算

基础设施(月付)

项目 费用 说明
CN2 GIA VPS ¥50~150/月 搬瓦工 CN2 GIA-E 较贵,dxclouds 阿里云套餐 ¥25.5 起
域名 ≈ ¥0/月 .top/.xyz 几块钱一年
Cloudflare 免费 免费版功能够用
Argo Smart Routing +$5/月(可选) 有付费用户群时值得开
基础月费 ≈ ¥60~200/月 取决于 VPS 档次

账号成本

阶段 账号类型 月费
初期 Claude Code Pro x1 + GPT 账号 ~$20/月
中期 上游账号供应商批量采购 按采购价浮动
长期 Claude Code Max $100~200/月

参考案例

以 CRS 方案为例,个人或小团队的典型月成本:

项目 费用 备注
VPS(Vultr 东京) ¥34/月 $5/月,1C/1G
SMS 接码 ¥14 仅首次注册
Claude Pro Plan ¥117/月 $17/月
月均合计 ≈ ¥150/月 首月 ¥165

每月约 ¥150 即可使用满血 Claude Opus,对比第三方中转站(通常倍率 1.5x–4x)性价比优势明显。


总结

自己搭中转站涉及服务器选型、Nginx 调优、Cloudflare 配置、号池运营,完整跑通约需 1~2 周,长期运营需持续投入(主要是当客服)。

核心教训:省钱不能省在服务器线路上,流式响应不能走 Nginx 默认缓冲,Cloudflare 的各种"优化"对 API 都是灾难。


原文发布于 2026-05-08,整理于 2026-05-15