Skip to main content

LLM 接口

接口层负责处理模型通信、密钥轮换和速率限制。

OpenAICompatible

适用于任何实现了 OpenAI Chat Completions API 的提供商:
兼容:OpenAI、OpenRouter、Together、Groq、本地 vLLM、Ollama 等。

OpenAIResponsesCompatible

适用于实现了 OpenAI Responses API 的提供商:
与 OpenAICompatible 的区别:
  • 将系统提示词映射到 instructions 字段
  • 处理 Responses 特有的流式事件
  • 支持 reasoning={...} kwargs 来控制推理力度
  • 工具调用的协议格式不同
从装饰器代码层面看,两种适配器的使用方式完全相同。协议格式差异在内部处理。

APIKeyPool

通过轮询机制管理多个密钥:
当某个密钥触发速率限制时,密钥池会自动切换到下一个。将配额最高的密钥放在最前面。

速率限制

内置令牌桶速率限制器:
速率限制器是按实例生效的。针对同一模型的多个 OpenAICompatible 实例可以有不同的速率限制。

传递 LLM kwargs

额外参数会被转发给提供商:
对于 OpenAIResponsesCompatible,可以传递推理力度参数:

上下文窗口

设置 context_window 以启用依赖模型容量信息的框架功能:
用于:自动压缩阈值计算、token 使用量追踪。 默认值:200,000 个 token。 API 参考:接口