任务场景
对话(chat)、编程(coding)、办公文档(office)、智能体(agent)等。不同场景对模型能力的要求不同。
按任务场景和优化目标自动选择“够用又更省”的模型。
Auto 是 TokenPlan 的核心能力:把 model 设为 auto,平台会为每次请求自动选择“够用又更省”的模型,你无需自己判断该用哪个模型。
不同任务对模型的要求差别很大:简单问答用轻量模型就够,复杂推理才需要旗舰模型。手动为每种场景挑模型既费心又容易用贵。
Auto 会根据任务难度和成本自动匹配,平均可节省约 30% 的调用成本,同时保证效果够用。
只需把 model 填成 auto,其余调用方式与普通调用完全一致。
| 协议 | 请求地址 |
|---|---|
| OpenAI Chat Completions | https://openapi.youdao.com/llmgateway/api/v1/chat/completions |
| OpenAI Responses | https://openapi.youdao.com/llmgateway/api/v1/responses |
| Anthropic Messages | https://openapi.youdao.com/llmgateway/anthropic/v1/messages |
调用示例:
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["YOUDAO_LLM_API_KEY"],
base_url="https://openapi.youdao.com/llmgateway/api/v1",
)
response = client.chat.completions.create(
model="auto", # 交给系统自动路由
messages=[
{"role": "user", "content": "帮我重构这段代码"}
]
)
print(response.choices[0].message.content)
# 查看本次实际命中的模型和成本
print("本次模型:", response.model, "| 成本:", response.cost)Auto 会先识别请求的任务场景,再结合优化目标选出最合适的模型:
对话(chat)、编程(coding)、办公文档(office)、智能体(agent)等。不同场景对模型能力的要求不同。
在“效果”和“成本”之间的取向,分为均衡、成本优先、质量优先三类,默认均衡。
response.model 回显实际命中的模型,通过 response.usage 回显本次消耗的额度,路由结果及 token 用量一目了然。auto 换成具体模型 ID 即可,两种方式可以在同一套代码里自由切换。Auto 可选择的模型范围与套餐档位相关,档位越高、可路由的模型质量越高:
| 场景 | 建议 |
|---|---|
| 不确定该用哪个模型 / 希望自动省钱 | 用 auto |
| 混合多模态任务(有简单有复杂) | 用 auto |
| 对输出风格、能力有明确要求 | 指定具体模型 ID |
| 需要结果可复现、锁定同一模型 | 指定具体模型 ID |
指定模型的用法见 模型列表 。