Dify 接入
使用 Dify 开源平台接入 TokenFlash API 中转站,实现低成本调用 Claude、GPT、Gemini 等主流大模型,完成智能客服、文档问答、工作流自动化。
Dify 是一个开源的大语言模型(LLM)应用开发平台,结合了 AI 工作流编排、RAG(检索增强生成)、Agent 智能体、模型管理等核心能力,让开发者和非技术用户都能快速构建生产级 AI 应用。
对 TokenFlash 来说,Dify 最常见的接法就是把它当作 OpenAI-API-compatible provider 来配置。一个 API Key 即可调用所有模型。

核心功能
| 功能模块 | 说明 | 适用场景 |
|---|---|---|
| 应用编排 | 可视化拖拽式构建 AI 应用 | 快速搭建 Chatbot、Agent |
| RAG 引擎 | 内置文档向量化、检索增强生成 | 企业知识库问答、文档分析 |
| Agent 框架 | 支持 Function Call、ReAct 推理模式 | 工具调用、多步推理任务 |
| 工作流 (Workflow) | 条件分支、循环、变量传递的节点式编排 | 复杂业务流程自动化 |
| 模型管理 | 统一管理多个模型供应商,灵活切换 | 多模型对比、降级策略 |
| API 发布 | 一键将应用发布为 RESTful API | 与现有系统集成 |
为什么用 Dify + TokenFlash
| 对比维度 | 官方 API | TokenFlash 中转 |
|---|---|---|
| 价格 | 原价 | GPT 5 折、Claude 6 折,其他模型按分组配置 |
| 模型覆盖 | 单一供应商 | Claude + GPT + Gemini 一站式 |
| 接口 | 各供应商地址不同 | 统一 TokenFlash 地址 |
| Dify 接入 | 需分别配置多个供应商 | 统一 OpenAI-compatible 接口 |
部署 Dify
Docker Compose 部署(推荐)
前置要求: Linux 2 核 4GB+、Docker 20.10+、Docker Compose 2.0+
git clone https://github.com/langgenius/dify.git
cd dify/docker
cp .env.example .env
# 可选:编辑 .env 中的 SECRET_KEY、DB_PASSWORD、REDIS_PASSWORD
docker compose up -d启动后访问 http://your-server/install 设置管理员账号。
# 验证所有容器正常运行
docker compose ps所有容器状态应为 Up。之后访问 Dify 主界面。
Dify Cloud
如果你不想部署,可直接使用 Dify Cloud:
- 注册账号(支持 GitHub / Google 登录)
- 创建工作空间
- 进入控制台
接入 TokenFlash API(核心章节)
获取 TokenFlash API Key
- 登录 TokenFlash 控制台
- 进入 API Keys → 创建新 Key
- 复制并保存(创建后不再显示)
在 Dify 中添加模型
- 点击右上角 头像 → 设置 → 模型供应商
- 找到 OpenAI-API-compatible 并点击进入
| 字段 | 值 |
|---|---|
| 模型名称 | 见下方列表 |
| API Key | 你的 TokenFlash API Key |
| API Endpoint URL | https://tokenflash.cn/v1 |
| 模型类型 | LLM / Text Embedding |
| 上下文长度 | 见下方列表 |
推荐添加的模型
GPT 系列:
| 模型名称 | 上下文长度 | 说明 |
|---|---|---|
gpt-5.6-sol | 1048576 | 综合能力最强 |
gpt-5.6-terra | 1048576 | 性价比之选 |
gpt-5.6-luna | 1048576 | 轻量快速 |
gpt-5.5 | 128000 | 通用任务 |
Claude 系列(通过 OpenAI 协议适配):
| 模型名称 | 上下文长度 | 说明 |
|---|---|---|
claude-sonnet-5 | 200000 | 速度与质量平衡 |
claude-opus-4-8 | 200000 | 最强推理能力 |
claude-fable-5 | 200000 | 推理增强 |
Gemini 系列:
| 模型名称 | 上下文长度 | 说明 |
|---|---|---|
gemini-3.5-flash | 1048576 | 高速高效 |
gemini-3.1-pro-high | 1048576 | 最强推理 |
Embedding 模型(RAG 知识库用):
| 模型名称 | 模型类型 | 上下文长度 |
|---|---|---|
text-embedding-3-small | Text Embedding | 8191 |
text-embedding-3-large | Text Embedding | 8191 |
添加时「模型类型」必须选择 Text Embedding,否则知识库向量化无法正常工作。
验证模型可用性
添加后在模型供应商页面应显示绿色"已连接"标记。也可创建测试 Chatbot 发送消息验证。
构建 AI 应用
Chatbot 应用
- 工作室 → 创建空白应用 → 聊天助手
- 选择刚添加的 TokenFlash 模型(如
gpt-5.6-sol) - 配置参数:Temperature 0.7、Max Tokens 4096
- 编写系统提示词定义角色行为
- 发布 并测试
Agent 应用
Agent 可以调用外部工具,具备更强的推理和执行能力:
- 创建应用时选择 Agent 类型
- 选择推理策略:Function Call(推荐,
gpt-5.6-sol/claude-sonnet-5均支持) - 在"工具"区域添加内置工具(Google Search、Wikipedia、计算器等)
- 可关联知识库增强回答准确性
Workflow 工作流
Workflow 允许通过节点式编排实现复杂业务逻辑:
| 节点类型 | 功能 |
|---|---|
| 开始 (Start) | 定义输入变量 |
| LLM | 调用大语言模型 |
| 知识检索 | 从知识库检索相关内容 |
| 条件分支 (IF/ELSE) | 根据条件走不同分支 |
| 代码执行 | 运行 JavaScript / Python 代码 |
| HTTP 请求 | 调用外部 API |
| 模板转换 | 使用 Jinja2 格式化文本 |
| 结束 (End) | 定义输出变量 |
智能文档问答工作流示例:
[开始] → [知识检索] → [IF/ELSE]
├─ 有结果 → [模板转换] → [LLM] → [结束]
└─ 无结果 → [LLM] → [结束(附"仅供参考"提示)]节点间通过 {{start.query}}、{{knowledge.retrieval_result}} 等语法传递变量。
RAG 知识库配置
创建知识库
- 左侧导航 知识库 → 创建知识库
- 选择索引方式:高质量模式(使用 Embedding 模型,推荐)
- 选择
text-embedding-3-small(性价比最高)
文档导入
支持 PDF、TXT、Markdown、DOCX、HTML、XLSX、CSV 等格式,单文件最大 15MB。
分段策略建议:
| 参数 | 推荐值 |
|---|---|
| 分段标识 | 双换行(\n\n) |
| 最大长度 | 500-800 字符 |
| 重叠长度 | 50-100 字符 |
检索策略
| 策略 | 说明 |
|---|---|
| 向量检索 | 基于语义相似度匹配 |
| 全文检索 | 基于关键词匹配(BM25) |
| 混合检索 | 综合排序(推荐) |
推荐配置:混合检索、Top K 5、Score 阈值 0.5。
实战案例
案例一:智能客服机器人
基于公司知识库创建自动回答常见问题的客服应用:
- 导入产品手册、FAQ、售后政策等文档创建知识库
- 创建 Chatbot 应用,关联知识库,模型使用
claude-sonnet-5 - 配置系统提示词限定回答范围和语气
- 设置预设问题(开场白)引导用户
API 调用示例:
curl -X POST 'https://你的dify域名/v1/chat-messages' \
-H 'Authorization: Bearer app-你的应用API密钥' \
-H 'Content-Type: application/json' \
-d '{"inputs": {}, "query": "你们的产品价格是多少?", "response_mode": "blocking", "user": "user-123"}'案例二:多步骤工作流自动化
自动生成研究报告的工作流:
[开始] 接收主题
↓
[LLM-1: gpt-5.6-luna] 生成报告大纲
↓
[知识检索] 用大纲关键词检索知识库
↓
[LLM-2: gpt-5.6-sol] 基于大纲+检索结果撰写报告
↓
[LLM-3: claude-sonnet-5] 校对优化
↓
[结束] 输出最终报告不同模型各司其职 — 轻量模型做简单任务,强模型做复杂任务,充分利用 TokenFlash 的多模型优势。
高级配置
多模型路由策略
成本分级:
| 任务类型 | 推荐模型 | 成本 |
|---|---|---|
| 简单问答、分类 | gpt-5.6-luna | 极低 |
| 一般对话、总结 | gpt-5.6-terra | 低 |
| 复杂分析、创作 | gpt-5.6-sol / claude-sonnet-5 | 中 |
| 超长上下文研究 | gemini-3.1-pro-high | 中 |
速率限制
Dify 应用设置中可配置每分钟最大调用次数、每日最大 Token 消耗量。
避免触发 429 的建议:降低并发、实现重试机制。
日志与监控
- Dify 内置 日志与标注 页面查看对话记录、Token 消耗、响应延迟
- Docker 日志:
docker compose logs -f api - 可集成 Prometheus + Grafana 监控 API 延迟、错误率、Token 消耗速率
常见问题
模型添加后无法使用
排查:
# 测试 API 连通性
curl -I https://tokenflash.cn/v1/models
# 测试模型调用
curl -X POST https://tokenflash.cn/v1/chat/completions \
-H "Authorization: Bearer sk-你的Key" \
-H "Content-Type: application/json" \
-d '{"model":"gpt-5.6-sol","messages":[{"role":"user","content":"hi"}]}'
# 检查 Dify 日志
docker compose logs api | grep -i error常见原因:API Key 错误、模型名称拼写错误、Endpoint URL 缺少 /v1、账户余额不足。
API 连接超时
- 检查 Dify 服务器到
https://tokenflash.cn/v1的网络连接 - 增加超时:
.env中设置MODEL_REQUEST_TIMEOUT=120,重启服务 - 配置代理:
.env中设置HTTP_PROXY和HTTPS_PROXY
Embedding 模型不可用
确认模型类型选择了 Text Embedding(非 LLM),且验证状态为"已连接"。切换 Embedding 模型后需要创建新知识库并重新向量化。
上下文长度设置
| 模型 | 建议上下文长度 |
|---|---|
gpt-5.6-sol | 128000 |
gpt-5.6-terra | 128000 |
claude-sonnet-5 | 100000 |
gemini-3.5-flash | 200000 |
上下文并非越大越好,过大会增加 Token 消耗和响应延迟。
与官方 API 的差异
| 对比项 | 官方 API | TokenFlash |
|---|---|---|
| 响应速度 | 直连最低 | 多一跳,增加 50-200ms |
| 模型版本 | 第一时间 | 可能有短暂延迟 |
| 稳定性 | SLA 保障 | 多重容灾 |
| 价格 | 原价 | GPT分组 5 折、Claude分组 6 折 |
快速配置速查
OpenAI 协议 Base URL: https://tokenflash.cn/v1
Dify 通道: OpenAI-API-compatible
API Key: 你的 TokenFlash API Key
推荐模型:
LLM: gpt-5.6-sol / gpt-5.6-terra / claude-sonnet-5
Embedding: text-embedding-3-small
Gemini: gemini-3.5-flash / gemini-3.1-pro-high