我要投稿

Weavel Ape超过DSPy，或将成为最好用的提示（prompt）优化工具

发布日期：2024-09-17 21:06:40 浏览次数： 2908

作者：AI工程化

微信搜一搜，关注“AI工程化”

随着LLM应用的越来越多，工程师们面临的一大挑战是如何精准地设计出最优的prompt。这个过程往往需要通过不断的尝试和迭代来完成。加之大型模型的输出具有概率性，每次的输出结果都可能有所差异，这进一步增加了调试提示的难度。为了优化一段提示，工程师们可能需要投入数小时甚至更长的时间。因此，掌握如何撰写有效的提示以及如何对提示进行优化，已成为当前迫切且日益增长的需求。

之前，笔者也介绍过一些这一领域的工具，比如：PromptPerfect，DSPy等，可查看阅读：

Langchain创始人新项目Auto-Prompt Builder一键优化你的Prompt，再也不担心写不好Prompt了

DSPy（声明式自改进语言程序），面向大模型编程的新方法，克服当前LLM应用开发的诸多缺点

今天，介绍一款当前这一领域最强工具——Ape，它是由YC资助的创业公司Weavel开发的一款prompt优化工具，它在GSM 8 K基准测试中得分高达93%，超过BaseLLM的70%及DSPy的86%。

同时，它也可以自动生成评估代码，并使用LLM作为判断，或者自己设置评估指标。

Ape的核心理念非常简单：

好的输入 + 正确的引导 = 更好的提示。

APE的设计实现受到DSPy的影响，采用数据+迭代的方式进行prompt自我优化，得益于平台产品化的设计，整体使用门槛大大降低，易于上手。

它具备以下能力：

通过分析prompt和数据集生成评估代码
运行批量测试来评估prompt
从之前的测试中提取反馈和洞察
通过使用贝叶斯优化等统计方法找到最佳prompt
在改进prompt时考虑Human-in-loop的反馈

它的工作原理如下：

记录输入输出：仅需一行代码，即可开始记录LLM的调用。
数据集过滤：Ape将日志过滤成数据集。
生成评估代码：Ape使用LLM作为复杂任务的评估者。
持续优化：随着更多生产数据的加入，Ape会持续优化提升prompt性能。

虽然，APE内核已经被开源到github（https://github.com/weavel-ai/Ape），但目前缺乏使用帮助，集成使用可能还需要再等一段时间。当前可以在Weavel产品上体验APE，过程比较简单：

通过创建prompt，添加数据，开启优化三步就能完成prompt优化，训练数据除了上传外，也可以通过接口采集，同时APE提供了prompt版本化以及评估的功能，包含大量的评估方法，如下图。

APE相较于其他工具在能力层面已达到prompt工具的高级水平（prompt的工具分级金字塔详见：一文探秘LLM应用开发(23)-Prompt(相关工具)），这样很容易形成这样的迭代机制，进而保证prompt一直能够不劣化，这和小模型每日更新避免模型性能衰退逻辑十分相似。

数据+迭代的模式已经被验证是行之有效的prompt优化方法，以此思路启发，进一步构建一个“数据+迭代”的自学习LLM应用将是一个新的热点命题。

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2026-05-31

写Prompt别再拽高级词汇了，用大白话效果反而更好

2026-05-30

Codex 入门最佳实践「OpenAI官方」

2026-05-29

天猫新品团队AI编码实战指南（下）

2026-05-27

我帮1000+程序员改过简历，把压箱底的提示词全公开了

2026-05-25

GPT-Image-2 提示词库：583+ 个真实可用的图像生成提示词

2026-05-25

Codex「自我蒸馏」提示词进化版！官方团队给出更强方案，一键打包你的专属工作流

2026-05-24

让你的 AI Agent更加听话

2026-05-24

高质量测试 Skill 编写手册 -- 渐进式披露

联系获取

联系获取

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

2026 Claude Skills 全岗位合集（新增篇）：6类全新岗位，18个高价值Agent Skill，告别无效加班

2026-03-07

OpenAI 发布 Codex 最佳实践指南：AI 编程工作流首次曝光

2026-03-13

别再裸用 Claude Code，这 20 个隐藏命令，太爽了

2026-03-18

GPT Image 2 提示词图库开源站点来了

2026-04-21

不再触发Claude使用限制，大幅降低Token的10个有效习惯！

2026-04-07

哭了！早知道这些Claude Code快捷键和命令，我能少熬80%的夜！

2026-03-05

TRAE 技术专家推荐：6个技巧让你的 Agent 更听话

2026-03-16

Claude Code终极指令速查表

2026-03-26

7 个 Karpathy 式提示词，让 Claude 变成你的研究员、工程师和思考搭档

2026-03-26

我逆向了 329 条 GPT-Image2 提示词模板，全部开源！

2026-04-25

大家都在问

Search Agent 要如何构造复杂有效的Query？

2026-05-23

写给产品经理的"AI工程"指南：提示词工程、上下文工程、Harness 工程到底是啥？

2026-05-16

AI 工程化实战：如何像设计函数参数一样设计 System Prompt？

2026-04-14

Google说只有5%的人真正会用AI，他们做对了什么？

2026-02-28

Prompt caching 技术是如何实现 1 折的推理成本优化的？

2026-02-12

几句话就能复刻一个付费Skill，Skills商店还能卖什么？

2026-02-12

从 Prompt 到 Skills：如何把业务流程切开，塞进AI的“技能槽”里？

2026-02-08

Prompt 的本质是“思维压缩包”：如何从结果中反推创作者的认知模型？

2026-02-05

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS Skill 提示词技巧 AI+电商 AI面试数字员工 ChatBI AI知识库开源大模型智能营销智能硬件 FDE AI+医疗 MaxKB Palantir Glean Openclaw

应聘简历请发送至： ceo@53ai.com

联系我们

售前咨询

预约演示

微信扫码

添加专属顾问

回到顶部