模型

BGE-M3

仅本地 开源 可商用
智源研究院 · BGE · MIT · 568M · 上下文 8K
能做什么
知识问答长文档分析
部署门槛
CPU 可跑
上下文
8K
token 窗口
参数
568M
BGE

01基础参数

参数规模
568M
上下文窗口
8K
输入模态
text
可生成
embedding
模型系列
BGE
开源许可
MIT
主要语言
multi

02部署门槛详情

硬件等级 CPU 可跑

03Benchmark 评测

待补充

04适用场景

✓ 适用
多语言RAG系统中的混合检索、跨语言语义搜索与文档召回、长文档的向量化表示
✗ 不适用
文本生成或对话任务(纯Embedding模型)、需要实时响应的极低延迟场景(需配合重排序)

05部署与限制

⚙ 本地部署建议
模型约2.27GB,CPU可跑,无需GPU。推荐使用HuggingFace的sentence-transformers库或Ollama快速部署。量化版(如Q4_K_M)可进一步降低资源占用。
⚠ 已知限制
作为Embedding模型,只能生成向量表示,无法用于对话或生成。官方建议配合重排序模型(如bge-reranker)组成完整RAG流水线以达到最佳效果。

06详细介绍

BGE-M3是北京智源人工智能研究院(BAAI)于2024年推出的多功能、多语言、多粒度文本嵌入模型。它基于XLM-RoBERTa架构,拥有约5.68亿参数和1024维嵌入向量维度。其核心特色在于单一模型同时支持密集检索(Dense Retrieval)、稀疏检索(Sparse Retrieval)和多向量检索(Multi-Vector Retrieval)三种功能,覆盖了从关键词匹配到语义理解的不同检索需求,适合构建混合检索系统以提升RAG系统的召回准确率。

该模型支持超过100种语言,并可处理长达8192个Token的输入序列,能够应对从短句到长文档的不同粒度内容。模型采用MIT开源协议,可免费用于商业用途,且对硬件要求友好,适合在CPU环境下部署。在RAG流水线中,官方推荐使用BGE-M3结合重排序模型(Reranker)的方式,先通过混合检索召回相关文档,再利用重排序模型进行精排,以获得最佳效果。

07官方资源

08同类模型