如何通过模型路由降低 60% LLM 成本
我们接触的多数工程团队把所有请求都路由到 GPT-4 或 Claude 3 Opus——即使任务很简单。结果是烧钱速度是本应有水平的 5-10 倍。
洞察:任务难度差异很大
客服聊天机器人、代码自动补全、复杂法律合同分析,这三类任务的能力要求天差地别。但多数团队用同一个模型。
模型路由原理
Westtree API 网关允许根据请求类型路由到不同模型。真实示例:
- 简单意图分类 → Gemini 1.5 Flash(输入 $0.075/M)
- 多轮对话 → GPT-4o(输入 $5/M)
- 复杂推理 → Claude 3.5 Sonnet(输入 $3/M)
算笔账
假设流量分布:简单 70%、中等 20%、复杂 10%。朴素路由(全部 GPT-4)平均成本约 $50/M tokens;智能路由约 $20/M——节省 60%。
落地
在 Westtree 中配置路由约需 10 分钟。在控制台定义规则,网关自动处理。