文档

Auto 智能路由

按任务场景和优化目标自动选择“够用又更省”的模型。

Auto 是 TokenPlan 的核心能力:把 model 设为 auto,平台会为每次请求自动选择“够用又更省”的模型,你无需自己判断该用哪个模型。

为什么用 Auto

不同任务对模型的要求差别很大:简单问答用轻量模型就够,复杂推理才需要旗舰模型。手动为每种场景挑模型既费心又容易用贵。

Auto 会根据任务难度和成本自动匹配,平均可节省约 30% 的调用成本,同时保证效果够用。

怎么用

只需把 model 填成 auto,其余调用方式与普通调用完全一致。

支持协议

协议请求地址
OpenAI Chat Completions
https://openapi.youdao.com/llmgateway/api/v1/chat/completions
OpenAI Responses
https://openapi.youdao.com/llmgateway/api/v1/responses
Anthropic Messages
https://openapi.youdao.com/llmgateway/anthropic/v1/messages

调用示例:

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["YOUDAO_LLM_API_KEY"],
    base_url="https://openapi.youdao.com/llmgateway/api/v1",
)

response = client.chat.completions.create(
    model="auto",  # 交给系统自动路由
    messages=[
        {"role": "user", "content": "帮我重构这段代码"}
    ]
)

print(response.choices[0].message.content)
# 查看本次实际命中的模型和成本
print("本次模型:", response.model, "| 成本:", response.cost)

路由怎么决策

Auto 会先识别请求的任务场景,再结合优化目标选出最合适的模型:

任务场景

对话(chat)、编程(coding)、办公文档(office)、智能体(agent)等。不同场景对模型能力的要求不同。

预期目标

在“效果”和“成本”之间的取向,分为均衡、成本优先、质量优先三类,默认均衡。

路由结果:可查、可控

  • 可查:每次响应会通过 response.model 回显实际命中的模型,通过 response.usage 回显本次消耗的额度,路由结果及 token 用量一目了然。
  • 可控:如果你更希望固定使用某个模型,随时把 auto 换成具体模型 ID 即可,两种方式可以在同一套代码里自由切换。

覆盖范围按套餐递增

Auto 可选择的模型范围与套餐档位相关,档位越高、可路由的模型质量越高:

具体覆盖的模型以实际套餐为准。

什么时候用 Auto,什么时候指定模型

场景建议
不确定该用哪个模型 / 希望自动省钱用 auto
混合多模态任务(有简单有复杂)用 auto
对输出风格、能力有明确要求指定具体模型 ID
需要结果可复现、锁定同一模型指定具体模型 ID

指定模型的用法见 模型列表