粘贴提示词,查看在 GPT、Claude、Gemini、Qwen、DeepSeek 上的 token 数和费用,再对比两个模型
| 模型 | Token | 输入 | 输出 | 单次请求 | {n} 次请求 | 上下文 | 放得下吗? |
|---|
大语言模型按 token 计费,一个 token 是一小段文本,大约相当于一个英文单词的四分之三。服务商分别对你发送的 token(输入)和模型写回的 token(输出)收费,而输出通常要贵好几倍,所以一个简短的问题配上很长的回答,可能比一篇长文档配上简短的摘要更贵。
选择模型时,价格只是其中一个维度。上下文窗口决定模型一次能考虑多少文本,从大约十万 token 到一百万甚至更多;速度决定聊天是否感觉即时;而多模态模型还能读图片、听音频或看视频。便宜快速的模型适合分类、信息抽取和高并发聊天,而旗舰和推理模型在困难的编程、分析和规划任务上物有所值。
把 GPT、Claude、Gemini、Qwen、DeepSeek、Grok 和 Llama 这一类模型并排比较,能在项目扩大规模之前让取舍一目了然:把单次请求的费用乘以你的月请求量,十倍的价格差距就变成了预算中的一项实实在在的开支。开放权重模型还增加了另一种选择,因为它们可以在你自己的硬件上运行,也可以通过多个相互竞争的托管方使用。