[Feature] 支持 qwen3-vl-embedding 等多模态向量模型的图文检索
还没有人认领这个 Issue。
评估
- 难度
- 5/5
- 预计耗时
- 一周以上
- 新手友好度
- 30/100
- Issue 类型
- 功能
- 描述清晰度
- 需要澄清
- 活跃度
- 活跃
- 技术栈
- python
调研方向
首先跟踪调用 embed_query(text) 和 embed_documents(List[str]) 的 PGVector 摄取与查询入口,然后检查模型抽象支持的输入类型。定义图像输入和混合文本-图像输入、模型元数据、维度以及模态信息的表示方式,同时保留现有的文本嵌入。完成的标准是:兼容的摄取和检索路径支持所请求的模态,且不混合不兼容的向量。
由索引模型根据 Issue 内容生成。
描述
MaxKB Version
2.10.5
Please describe your needs or suggestions for improvements
当前 MaxKB 的知识库向量化和检索流程只支持纯文本 Embedding,无法使用 qwen3-vl-embedding 等多模态向量模型进行图片向量化和图文跨模态检索。
在配置多模态向量模型后,图片内容仍只能先经过 OCR 或视觉模型转换为文本,再生成文本向量,无法直接生成图片向量。因此无法实现“文字检索图片”“图片检索文字”以及图文统一向量空间检索。
Please describe the solution you suggest
建议增加多模态向量模型能力:
- 在模型配置中标识文本、图片或图文多模态输入能力;
- 向量化任务支持将图片文件传递给 Embedding 模型,而不仅是
List[str]; - 查询侧支持文本、图片和图文混合输入;
- 向量存储和索引记录模型、维度及模态信息,避免与现有文本向量混用;
- 保持现有纯文本 Embedding 和已有知识库的兼容性。
Additional Information
MaxKB v2.10.5-lts 的 PGVector 入库和查询均调用 embed_query(text) / embed_documents(List[str]),当前模型抽象没有图片输入通道。
- 主要语言
- Python
- 星标
- 22.8k
- 派生
- 3.2k
- 平均合并
- 46 分钟
- 30 天内合并 PR
- 322
贡献指南
从这里开始
- 先读完整个 Issue,再读项目的贡献指南。
- 在 Issue 下留言说明你要接手 —— 这能避免两个人做同样的事。
- Fork 仓库,在一个分支上完成修改。
- 提交 Pull Request,并在描述里引用这个 Issue 编号。
1Panel-dev/MaxKB 的其他 Issue
-
1Panel-dev/MaxKB#7143 · 已指派 1 人 ·
-
难度 3/5 1-2 天 新手友好度 72/100
1Panel-dev/MaxKB#7081 · 1 条评论 ·
-
Status: Awaiting Feedback
1Panel-dev/MaxKB#7069 · 9 条评论 · 已指派 1 人 ·
-
Type: Bug
1Panel-dev/MaxKB#7062 · 2 条评论 · 已指派 1 人 ·
-
1Panel-dev/MaxKB#7053 · 已指派 1 人 ·
相似的 Issue
-
area: harness bug status: needs-triage
难度 2/5 1-3 小时 新手友好度 75/100
Human-Agent-Society/reef#625 ·
-
难度 2/5 1-3 小时 新手友好度 70/100
-
难度 1/5 1 小时以内 新手友好度 80/100
learningequality/kolibri#15351 · 2 条评论 ·
-
难度 2/5 1-3 小时 新手友好度 75/100
-
Name consistency 未关闭
难度 2/5 1-3 小时 新手友好度 75/100
eellak/triplestore#65 · 1 条评论 ·