Hacktoberfest 2026:维护者为十月标记出来的 issue,仍然开放、适合新手。 浏览 Hacktoberfest issue

[Feature] 支持 qwen3-vl-embedding 等多模态向量模型的图文检索

未关闭
#6,879 1 条评论 0 个 reaction 已指派 0 人 在 GitHub 查看

还没有人认领这个 Issue。

评估

难度
5/5
预计耗时
一周以上
新手友好度
30/100
Issue 类型
功能
描述清晰度
需要澄清
活跃度
活跃
技术栈
python

调研方向

首先跟踪调用 embed_query(text) 和 embed_documents(List[str]) 的 PGVector 摄取与查询入口,然后检查模型抽象支持的输入类型。定义图像输入和混合文本-图像输入、模型元数据、维度以及模态信息的表示方式,同时保留现有的文本嵌入。完成的标准是:兼容的摄取和检索路径支持所请求的模态,且不混合不兼容的向量。

由索引模型根据 Issue 内容生成。

描述

Type: Feature Request
MaxKB Version

2.10.5

Please describe your needs or suggestions for improvements

当前 MaxKB 的知识库向量化和检索流程只支持纯文本 Embedding,无法使用 qwen3-vl-embedding 等多模态向量模型进行图片向量化和图文跨模态检索。

在配置多模态向量模型后,图片内容仍只能先经过 OCR 或视觉模型转换为文本,再生成文本向量,无法直接生成图片向量。因此无法实现“文字检索图片”“图片检索文字”以及图文统一向量空间检索。

Please describe the solution you suggest

建议增加多模态向量模型能力:

  • 在模型配置中标识文本、图片或图文多模态输入能力;
  • 向量化任务支持将图片文件传递给 Embedding 模型,而不仅是 List[str]
  • 查询侧支持文本、图片和图文混合输入;
  • 向量存储和索引记录模型、维度及模态信息,避免与现有文本向量混用;
  • 保持现有纯文本 Embedding 和已有知识库的兼容性。
Additional Information

MaxKB v2.10.5-lts 的 PGVector 入库和查询均调用 embed_query(text) / embed_documents(List[str]),当前模型抽象没有图片输入通道。

主要语言
Python
星标
22.8k
派生
3.2k
平均合并
46 分钟
30 天内合并 PR
322

贡献指南

打开贡献指南

从这里开始

  1. 先读完整个 Issue,再读项目的贡献指南。
  2. 在 Issue 下留言说明你要接手 —— 这能避免两个人做同样的事。
  3. Fork 仓库,在一个分支上完成修改。
  4. 提交 Pull Request,并在描述里引用这个 Issue 编号。

1Panel-dev/MaxKB 的其他 Issue

查看 1Panel-dev/MaxKB 的全部 Issue

相似的 Issue

更多 Python Issue

把新 issue 发到你的邮箱

精选适合新手参与的 GitHub issue 摘要。