我要投稿

OpenAI革新性功能："Prompt Caching"—— 提速降本的双赢之选

发布日期：2024-10-03 06:20:27 浏览次数： 2704

作者：人人都要做自媒体

微信搜一搜，关注“人人都要做自媒体”

Prompt Caching 的 API

今天，我们介绍了 Prompt Caching 功能，允许开发者减少成本和延迟。通过重用最近看到的输入token，开发者可以获得50%的折扣和更快的提示处理时间。

Prompt Caching 的可用性和定价

从今天开始，Prompt Caching 自动应用于最新版本的 GPT-4o、GPT-4o mini、o1-preview 和 o1-mini，以及这些模型的细调版本。缓存的提示比未缓存的提示更便宜。

以下是定价概述：

模型	原价	缓存价格	每小时价格
GPT-4o-2024-08-06	$2.50 \| $1.25	$10.00
GPT-4o 细调	$3.75 \| $1.875	$15.00
GPT-4o mini-2024-07-18	$0.15 \| $0.075	$0.60
GPT-4o mini 细调	$0.30 \| $0.15	$1.20
o1-preview	$15.00 \| $7.50	$60.00
o1 mini	$3.00 \| $1.50	$12.00

监控缓存使用

对支持模型的 API 调用将自动从提示缓存中受益，前提是提示长度超过 1024 个token。API 缓存之前计算过的提示的最长前缀，从 1024 个token开始，增加 128 个token的增量。如果您重用具有共同前缀的提示，我们将自动应用 Prompt Caching 折扣，无需对 API 集成进行任何更改。

使用 Prompt Caching 的请求在 API 响应中的 ‘usage’ 字段中包含 ‘cached_tokens’ 值：

usage: {
total_tokens: 2306,
prompt_tokens: 2006,
completion_tokens: 300,
prompt_tokens_details: {
cached_tokens: 1920,
audio_tokens: 0,
},
completion_tokens_details: {
reasoning_tokens: 0,
audio_tokens: 0,
}
}

缓存通常在不活动 5-10 分钟后清除，并在缓存最后使用后的一小时内始终删除。如所有 API 服务一样，Prompt Caching 遵守我们的企业隐私承诺。提示缓存不会在组织之间共享。

Prompt Caching 是开发者在生产环境中扩展应用程序时平衡性能、成本和延迟的一种工具。更多信息，请参阅 [Prompt Caching 文档]。**

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2026-02-13

工具调用准确率从60%飙到95%？我用这个‘解耦微调’把Qwen-7B救活了

2026-02-05

普林斯顿大学RLAnything：AI学会一边学习一边给自己打分

2026-02-04

Agent 越用越聪明？AgentScope Java 在线训练插件来了！

2026-02-03

OpenClaw之后，我们离能规模化落地的Agent还差什么？

2026-01-30

Oxygen 9N-LLM生成式推荐训练框架

2026-01-29

自然·通讯：如何挖掘复杂系统中的三元交互

2026-01-29

微调已死？LoRA革新

2026-01-19

1GB 显存即可部署：腾讯 HY-MT1.5 的模型蒸馏与量化策略解析

联系获取

联系获取

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

2026年 LLM 微调全指南

2026-01-04

OpenAI公开新的模型训练方法：或许能解决模型撒谎问题，已在GPT-5 thiking验证

2025-12-04

DeepSeek 发布新论文，提出全新 MHC 架构，有何创新与应用前景？

2026-01-02

刚刚，梁文锋署名，DeepSeek元旦新论文要开启架构新篇章

2026-01-01

Open联合创始人：AI大模型2025年度回顾

2025-12-21

OpenClaw之后，我们离能规模化落地的Agent还差什么？

2026-02-03

【GitHub高星】AI Research Skills：一键赋予AI“博士级”科研能力，74项硬核技能库开源！

2026-01-18

大模型训练的高效内存解决方案：流水线感知的细粒度激活卸载，实现显存开销与吞吐性能的联合最优

2025-12-11

Agent 越用越聪明？AgentScope Java 在线训练插件来了！

2026-02-04

Llama Factory 实战，轻量级微调 LLM。

2025-12-21

大家都在问

OpenClaw之后，我们离能规模化落地的Agent还差什么？

2026-02-03

DeepSeek 发布新论文，提出全新 MHC 架构，有何创新与应用前景？

2026-01-02

LoAR做Fine-Tuning微调原理到底是什么？

2025-11-19

如何将 AI 代码采纳率从30%提升到80%？

2025-09-25

大模型微调，为什么99%的企业都不应该碰这个坑？

2025-06-20

万不得已，不要对 LLM 进行微调？

2025-06-17

可以将任何符合OpenAPI规范的接口转 MCP Server吗？

2025-05-21

OpenAI发布GPT-4.1系列模型，对行业最大吸引力是什么？

2025-05-17

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS 提示词框架提示词技巧 AI+电商 AI面试数字员工 ChatBI AI知识库开源大模型智能营销智能硬件智能化改造 AI+医疗 MaxKB Palantir Glean

应聘简历请发送至： ceo@53ai.com

联系我们

售前咨询

预约演示

微信扫码

添加专属顾问

回到顶部