生产使用场景

用于多语言聊天机器人的 LLM API

一个旅行产品支持英语、日语、西班牙语和中文。系统识别会话地区,加载对应地区的产品词表和政策片段,再要求模型回答,同时不得翻译受保护的产品名称。

保持地区术语一致的多语言客服对话
用于多语言聊天机器人的 LLM API

生产方案

API、主模型与故障切换配置

生产选择推荐配置原因
APIPOST /v1/chat/completions从服务端发送 OpenAI 兼容请求
主模型gemini-2.5-flashGemini 2.5 Flash 是多语言、延迟敏感对话工作负载的首选。
备用模型gpt-5.4-mini只有在某种语言通过相同母语审查时才使用 gpt-5.4-mini 备用;政策密集或混合语言失败升级到 Terra。
升级模型gpt-5.6-terra只有主路由越过已定义的质量或复杂度边界时才使用
输出契约场景专用文本或补丁地区语言正确、受保护术语保持不变,且不混入其他地区政策的回复。
01
业务场景

多语言聊天机器人在生产应用中的实际场景

一个旅行产品支持英语、日语、西班牙语和中文。系统识别会话地区,加载对应地区的产品词表和政策片段,再要求模型回答,同时不得翻译受保护的产品名称。

每种语言分别评分。不能因为平均分较高就上线某个语言;只有母语审查者认可该地区的意图、术语、语气和拒答行为后才上线。

02
应用架构

多语言聊天机器人工作流怎样运行

  • 分别识别语言和地区。
  • 加载地区词表和获准政策片段。
  • 直接用目标语言生成。
  • 检查受保护术语、数字和政策用语。
  • 不支持或低置信度语言转人工。
03
API 请求

通过 LLMFly AI 调用 gemini-2.5-flash

请求应从服务端发送。请将示例内容和占位工具 Schema 替换为应用中的真实数据与工具。

request.example可复制示例
curl https://app.llmfly.ai/v1/chat/completions \
  -H "Authorization: Bearer $LLMFLY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-2.5-flash",
    "messages": [
      {"role": "system", "content": "Reply in the detected locale. Preserve GLOSSARY terms exactly. Use only the supplied locale policy and do not translate protected product names."},
      {"role": "user", "content": "Explain the cancellation window in the customer's language using the locale policy."}
    ]
  }'
04
模型选择

为什么主模型选择 gemini-2.5-flash

Gemini 2.5 Flash 是多语言、延迟敏感对话工作负载的首选。

只有在某种语言通过相同母语审查时才使用 gpt-5.4-mini 备用;政策密集或混合语言失败升级到 Terra。

05
验收

多语言聊天机器人的验收条件

指标通过条件
意图保持在每种支持语言中,请求动作和约束都保持不变
术语准确性产品、法律和行业受控术语符合地区词表
母语审查采纳率母语审查者认可含义、语气和流畅度,无需实质改写
按语言统计的延迟与成本每种上线语言分别满足响应时间和会话成本预算
06
失败处理

上线前必须处理的失败情况

  • 假设英文质量代表所有语言
  • 机器翻译测试集
  • 忽略地区政策
  • 用平均值掩盖弱势语言
07
输出

返回结果与运行记录

地区语言正确、受保护术语保持不变,且不混入其他地区政策的回复。

每次生产运行都应记录模型 ID、Request ID、Token 用量、重试、验证结果和最终处理状态。

常见问题

可以用翻译后的英文提示词吗?

应使用母语样例,因为意图、语气、术语和政策会随地区变化。

一个模型应该处理所有语言吗?

只有每种语言都通过测试才可以;分别路由可能更稳妥。

如何测试语言混用?

使用真实混合语言消息,并验证意图和必要术语是否保留。

使用你的真实输入测试这套方案

让主模型和备用模型使用相同请求、工具和验证规则。

比较模型