微信扫码
添加专属顾问
我要投稿
今天给大家带来一篇腾讯最新开源的向量模型的论文,模型开源,在CMTEB上拿了第一名!嵌入/向量模型是Agent、RAG中很关键的一个组件,所以也是一个卷的很激烈的一个领域。
Conan-embedding: General Text Embedding with More and Better Negative Samples
随着RAG(检索增强生成)技术的日益普及,嵌入模型的能力正受到越来越多的关注。嵌入模型主要通过对比学习进行训练,其中负样本是一个关键组件。以往的研究提出了各种硬负样本挖掘策略,但这些策略通常被作为预处理步骤使用。在本文中,我们提出了conan-embedding模型,该模型最大化地利用更多、更高质量的负样本。具体来说,由于模型处理预处理负样本的能力在训练过程中不断发展,我们提出了一种动态硬负样本挖掘方法,以便在整个训练过程中使模型接触到更多具有挑战性的负样本。其次,对比学习需要尽可能多的负样本,但受限于GPU内存的限制。因此,我们使用了Cross-GPU平衡损失(Cross-GPU balancing Loss)来提供更多的负样本进行嵌入训练,并在多个任务之间平衡批量大小。此外,我们还发现LLM(大型语言模型)生成的提示-响应对可以用于嵌入训练。我们的方法有效地增强了嵌入模型的能力,目前在Chinese Massive Text Embedding Benchmark(CMTEB)排行榜上排名第一。
模型开源地址:https://huggingface.co/TencentBAC/Conan-embedding-v1
Conan-embedding模型,主要是提出了两个的新点子:Dynamic Hard Negative Mining和Cross-GPU Batch Balance Loss
论文里还提到了,用LLM生成的prompt-response对来训练嵌入模型,这样可以让模型更聪明,处理起文本来更得心应手。
Conan-embedding在CMTEB的六个任务上都取得了优异的成绩,超越了之前所有的模型。消融研究也证明了动态硬负样本挖掘和CBB Loss这两个方法的有效性。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费场景POC验证,效果验证后签署服务协议。零风险落地应用大模型,已交付160+中大型企业
2025-06-21
不需要 RAG!手把手教你构建问答 Agent(只需 30 分钟)
2025-06-21
一文搞懂什么是RAG
2025-06-21
Google | 溯源分析RAG系统错误,提出选择性生成框架,让RAG问答准确率提升10%
2025-06-20
鹅厂实习生血泪贴:Agent/RAG黑科技,真相竟是这样!
2025-06-20
拒绝AI“一本正经地胡说八道”:我用三版Prompt驯服RAG模型的实战复盘
2025-06-20
从0到1落地一个RAG智能客服系统
2025-06-20
RAG 知识库核心模块全解(产品视角 + 技术细节)
2025-06-20
不依赖于复杂框架,用简单易懂的实现教你二十三种RAG技巧!
2025-03-28
2025-04-01
2025-04-13
2025-04-19
2025-04-09
2025-04-16
2025-05-08
2025-04-01
2025-04-05
2025-04-10
2025-06-20
2025-06-19
2025-06-13
2025-06-09
2025-06-06
2025-05-30
2025-05-29
2025-05-29