DeepSeek API 创新采用硬盘缓存,价格再降一个数量级
在大模型 API 的使用场景中,用户的输入有相当比例是重复的。举例说,用户的 prompt 往往有一些重复引用的部分;再举例说,多轮对话中,每一轮都要将前几轮的内容重复输入。 为此,DeepSeek 启用上下文硬盘缓存技术,把预计未来会重复使用的内容,缓存在分布式的硬盘阵列中。如果输入存在重复,则重复的部分只需要从缓存读取,无需计算。该技术不仅降低服务的延迟,还大幅削减最终的使用成本。 缓存命中的部分,DeepSeek 收费 0.1元 每百万 tokens。至此,大模型的价格再降低一个数量级 1 。 注 1: API 价格已做调整,最新价格请参考 模型 & 价格 页面。 如何使用 DeepSeek API 的缓存服务 硬盘缓存服务已经全面上线,用户无需修改代码,无需更换接口,硬盘缓存服务将自动运行,系统自动按照实际命中情况计费。 注意,只有当两个请求的前缀内容相同时(从第 0 个 token 开始相同),才算重复。中间开始的重复不能被缓存命中。 以下为两个经典场景的缓存举例: 1. 多轮对话场景,下一轮对话会命中上一轮对话生成的上下文缓存 2. 数据分析场景,后续具有相同前缀的请求会命
相关来源
DeepSeek
DeepSeek API 创新采用硬盘缓存,价格再降一个数量级