资讯中心

并行智算云 Tokens 调用深度解析指南

📅 2026/8/25 23:33:40
并行智算云 Tokens 调用深度解析指南
适配并行智算云 MaaS 大模型服务兼容 OpenAI 兼容接口覆盖密钥、调用、Token 计量、性能调优、排错、成本管控并行智算云。一、平台概述并行智算云 MaaS 提供OpenAI 兼容 REST 接口支持 DeepSeek‑R1/V3、GLM‑4、Qwen 系列模型以Token作为核心计量单元输入、输出 Token 分开计费支持流式 / 非流式调用适配企业业务、科研推理、本地 AI 客户端接入场景并行智算云。核心概念什么是 TokenToken 是模型分词最小单元不等于汉字。中文约 1 汉字≈1.3‑1.8 Token英文约 4 个字母 1Token计费规则总费用 输入 Token× 输入单价 输出 Token× 输出单价系统返回体usage字段返回本次消耗的输入、输出 Token 数量并行智算云。二、前置准备API 密钥获取登录并行智算云控制台进入【API 密钥】页面新建密钥填写备注区分开发 / 测试 / 生产密钥仅创建时完整展示一次务必本地保存丢失只能重建最佳实践不同业务环境使用独立 API Key便于用量统计、权限隔离、密钥轮转禁止硬编码写死代码使用环境变量 /.env 存储密钥严禁提交 Git 仓库。BaseURLhttps://ai.paratera.com/v1鉴权 HeaderAuthorization: Bearer ${你的API‑KEY}并行智算云三、调用方式实战方式 1Python 调用OpenAI SDK 兼容from openai import OpenAI client OpenAI( api_key替换为你的API‑KEY, base_urlhttps://ai.paratera.com/v1 ) # 非流式调用 resp client.chat.completions.create( modelDeepSeek‑V3, messages[{role:user,content:请解释并行智算云Token调用机制}], temperature0.7, max_tokens1024 ) print(resp.choices[0].message.content) # Token消耗读取 print(f输入tokens:{resp.usage.prompt_tokens}) print(f输出tokens:{resp.usage.completion_tokens}) print(f总tokens:{resp.usage.total_tokens})方式 2CURL 调用curl --request POST \ --url https://ai.paratera.com/v1/chat/completions \ --header Authorization: Bearer 你的API‑KEY \ --header Content‑Type: application/json \ --data { model:DeepSeek‑V3, messages:[{role:user,content:介绍并行智算云}], max_tokens:512, temperature:0.6 }方式 3第三方客户端接入Chatbox/Cherry‑Studio选择OpenAI API类型填入API‑KEY平台生成密钥API 地址https://ai.paratera.com/v1模型 ID与平台模型列表保持一致例如DeepSeek‑R1并行智算云四、返回体 Token 字段深度解析标准返回片段{ id:xxx, choices:[...], usage:{ prompt_tokens:320, //输入Token计费 completion_tokens:148, //输出Token计费 total_tokens:468 } }prompt_tokens用户提问 历史上下文全部分词计数上下文越长输入 Token 越高成本上涨completion_tokens模型生成回答的 Token受max_tokens参数上限约束流式streamtrue调用默认流式返回分片不会直接返回 usage。方案开启stream_options:{include_usage:true}流结束分片返回完整 usage 统计用于业务侧记账、成本统计。流式调用示例片段stream_resp client.chat.completions.create( modelDeepSeek‑R1, messages[{role:user,content:长文本问答}], streamTrue, stream_options{include_usage:True}, max_tokens2048 ) for chunk in stream_resp: if chunk.usage: print(chunk.usage)五、关键参数调优与 Token 成本控制表格参数作用成本影响调优建议max_tokens模型最大生成输出 Token直接决定输出 Token 上限文档摘要设 1024‑4096简单问答设 512不要盲目设置超大值temperature采样随机性0‑2不直接消耗 Token值越大模型越爱生成长文本间接拉高输出 Token严谨任务 0.1‑0.3创意写作 0.7‑0.9messages上下文历史全部计入 prompt_tokens最大成本来源业务做上下文裁剪、摘要压缩丢弃无效历史避免对话无限膨胀 Token 消耗frequency_penalty重复惩罚不直接计费控制输出长短技术文档 0.2‑0.5减少重复输出节约 Token⚠️长上下文坑点128K 上下文模型如果你传入 100K 输入文本输入 Token 直接按 100K 计量收费即使模型实际只引用一小部分内容。六、Token 计费与用量看板并行智算云提供控制台用量看板支持按 API‑Key 维度统计输入 / 输出 Token、调用次数、首包延迟、错误率支持按模型拆分成本适合企业分部门核算计费模式按量后付费无最低消费输入输出分开计价预购 Token 包大批量业务单价折扣缓存优化命中缓存的输入 Token 会有折扣价适合高频重复查询场景稀土掘金。计费公式费用 prompt_tokens ×输入单价 completion_tokens ×输出单价。 不同模型单价不同以控制台计费页面为准。七、高频踩坑与排错调用返回 401 鉴权失败密钥复制多余空格密钥过期 / 已删除Bearer 后面空格缺失检查 BaseURL 是否带多余后缀。流式拿不到 Token 用量忘记开启stream_options{include_usage:True}usage 只会在最后一个 chunk 返回。Token 消耗远大于预期messages 携带大量历史对话系统提示词过长传入文档没有做截断。429 限流报错QPS、Token 速率达到配额控制台可调整配额业务侧增加重试 退避策略。max_tokens 设置过大报错max_tokensprompt_tokens 总和不能超过模型上下文窗口上限例如 128K 模型输入 120K则 max_tokens 最多只能设置 8K。八、企业级最佳实践用量监控告警对接平台用量接口设置阈值告警防止业务异常暴涨 Token 消耗上下文管理实现滑动窗口、历史摘要不要无限累积对话 messages密钥治理开发、测试、生产分开密钥定期轮换密钥缓存策略高频固定 Query业务层做缓存减少重复 Token 计费流式必开 usage 返回业务记账统计必须依赖接口返回 usage不要本地估算 Token 数量本地分词和平台分词器存在偏差会造成对账不一致。附录常用模型 ID 参考表格模型名称模型 ID上下文窗口DeepSeek‑V3DeepSeek‑V3128KDeepSeek‑R1DeepSeek‑R1128KGLM‑4‑LongGLM‑4‑Long1M模型 ID 以并行智算云控制台模型列表为准。