预约演示
← 返回全部岗位

网关运维工程师

正职

负责大模型 API 多渠道接入、质量探测、资源池调度与稳定性保障。

岗位背景

  1. 我们是一家快速成长的 AI Agent 公司,产品能力直接依赖稳定的大模型供给。多渠道 API 资源层是我们的核心基础设施——它一旦出现波动,线上业务即会受到直接影响。该岗位处于公司核心基础设施层,直接影响产品的稳定性与服务质量。
  2. 我们希望招募一名能够独立负责整个渠道层的工程师:将各家大模型 API 高效、稳定地接入,持续监测其服务质量,并在故障发生前主动发现与规避风险。
  3. 需要说明的是,这并非"按文档调用 API"的常规工作。大模型渠道生态较新、问题多、参考资料有限,许多场景缺乏标准答案,需要候选人凭借经验与钻研能力自行探索。

岗位职责

  1. 多渠道接入:对接 OpenAI(GPT)、Anthropic(Claude)、Gemini 等官方及第三方 API 渠道,处理鉴权、流式响应(SSE)、超时重试、限流(429)、并发控制等联调工作。
  2. 资源池调度与管理:负责多账号 / 凭证的生命周期管理,设计渠道路由与故障自动切换(failover)策略,平衡额度、可用性与成本。
  3. 质量评测与探测:建设渠道质量的自动化评测与探针体系。新渠道入池前完成验收(确认无降智、无模型偷换、延迟与输出格式达标);对在线渠道进行持续质量监测;并支持多渠道在质量、速度、成本维度的横向对比。
  4. 稳定性保障:搭建并维护监控告警体系(渠道延迟、成功率、余额、异常账号等),对线上异常快速响应。团队配备完善的自动化降级与告警机制,以尽量减少人工干预。
  5. 异常处理:针对掉线、封禁、限速、隐性降智等异常账号与渠道,实现自动检测与切换。

任职要求

  1. 具备独立接入至少 2 家大模型 API(官方或第三方均可)的实际经验,熟悉流式、重试、限流、并发等问题的处理。
  2. 配置过监控告警(延迟 / 成功率 / 余额等),具备编写多渠道路由或 failover 逻辑的经验。
  3. 扎实的运维基本功:熟悉 Linux、Docker,以及日志与监控工具(如 Grafana、Prometheus)。
  4. 熟练掌握 Go(优先)、Python 或 Node.js 至少一门语言,理解 HTTP、异步处理与 API 调用机制;团队后端主要使用 Go,熟悉 Go 并发模型者优先。
  5. 熟练使用 AI 辅助编程(Vibe Coding),如 Cursor、Claude Code、GitHub Copilot 等,能借助 AI 工具高效完成开发与问题排查。
  6. 学历与总工作年限不设硬性门槛,具备 1 年以上大模型相关实战经验即可。我们更看重实际解决问题的能力与踩坑积累,而非工作年限。

加分项

  1. 具备多账号轮询 / 调度及资源池管理经验。
  2. 能够识别渠道降智、模型偷换、隐性限速等问题,并具备相应应对手段。
  3. 熟悉成本优化,能够通过渠道 / 模型分流降低调用成本。
  4. 使用过主流 LLM SDK 或 Agent 框架(OpenAI、Anthropic 官方 SDK,LangChain、LlamaIndex、Vercel AI SDK 等)。
  5. 具备自动化测试用例与质量探针的设计能力。

我们期望的特质

  1. 抗压能力强:面对不稳定的渠道与突发告警,能够保持冷静与稳定。
  2. 强责任心(Ownership):遇到渠道问题会主动追查至根因,而非止于告警处理。
  3. 钻研精神:愿意深入排查"渠道为何突然劣化"这类缺乏文档与现成答案的疑难问题。
  4. 细致严谨:Key、额度、配置等任一数据出错都可能引发线上事故,需具备高度的细心与责任意识。