岗位背景
- 我们是一家快速成长的 AI Agent 公司,产品能力直接依赖稳定的大模型供给。多渠道 API 资源层是我们的核心基础设施——它一旦出现波动,线上业务即会受到直接影响。该岗位处于公司核心基础设施层,直接影响产品的稳定性与服务质量。
- 我们希望招募一名能够独立负责整个渠道层的工程师:将各家大模型 API 高效、稳定地接入,持续监测其服务质量,并在故障发生前主动发现与规避风险。
- 需要说明的是,这并非"按文档调用 API"的常规工作。大模型渠道生态较新、问题多、参考资料有限,许多场景缺乏标准答案,需要候选人凭借经验与钻研能力自行探索。
岗位职责
- 多渠道接入:对接 OpenAI(GPT)、Anthropic(Claude)、Gemini 等官方及第三方 API 渠道,处理鉴权、流式响应(SSE)、超时重试、限流(429)、并发控制等联调工作。
- 资源池调度与管理:负责多账号 / 凭证的生命周期管理,设计渠道路由与故障自动切换(failover)策略,平衡额度、可用性与成本。
- 质量评测与探测:建设渠道质量的自动化评测与探针体系。新渠道入池前完成验收(确认无降智、无模型偷换、延迟与输出格式达标);对在线渠道进行持续质量监测;并支持多渠道在质量、速度、成本维度的横向对比。
- 稳定性保障:搭建并维护监控告警体系(渠道延迟、成功率、余额、异常账号等),对线上异常快速响应。团队配备完善的自动化降级与告警机制,以尽量减少人工干预。
- 异常处理:针对掉线、封禁、限速、隐性降智等异常账号与渠道,实现自动检测与切换。
任职要求
- 具备独立接入至少 2 家大模型 API(官方或第三方均可)的实际经验,熟悉流式、重试、限流、并发等问题的处理。
- 配置过监控告警(延迟 / 成功率 / 余额等),具备编写多渠道路由或 failover 逻辑的经验。
- 扎实的运维基本功:熟悉 Linux、Docker,以及日志与监控工具(如 Grafana、Prometheus)。
- 熟练掌握 Go(优先)、Python 或 Node.js 至少一门语言,理解 HTTP、异步处理与 API 调用机制;团队后端主要使用 Go,熟悉 Go 并发模型者优先。
- 熟练使用 AI 辅助编程(Vibe Coding),如 Cursor、Claude Code、GitHub Copilot 等,能借助 AI 工具高效完成开发与问题排查。
- 学历与总工作年限不设硬性门槛,具备 1 年以上大模型相关实战经验即可。我们更看重实际解决问题的能力与踩坑积累,而非工作年限。
加分项
- 具备多账号轮询 / 调度及资源池管理经验。
- 能够识别渠道降智、模型偷换、隐性限速等问题,并具备相应应对手段。
- 熟悉成本优化,能够通过渠道 / 模型分流降低调用成本。
- 使用过主流 LLM SDK 或 Agent 框架(OpenAI、Anthropic 官方 SDK,LangChain、LlamaIndex、Vercel AI SDK 等)。
- 具备自动化测试用例与质量探针的设计能力。
我们期望的特质
- 抗压能力强:面对不稳定的渠道与突发告警,能够保持冷静与稳定。
- 强责任心(Ownership):遇到渠道问题会主动追查至根因,而非止于告警处理。
- 钻研精神:愿意深入排查"渠道为何突然劣化"这类缺乏文档与现成答案的疑难问题。
- 细致严谨:Key、额度、配置等任一数据出错都可能引发线上事故,需具备高度的细心与责任意识。