返回实战笔记列表

ChatBox 的视觉模型的作用

这触及到了多模态 AI 的核心。使用 视觉模型,意味着 ChatBox 这类工具正在从一个只能读文字的助手,升级为一个 既能读文字,也能看懂图片的助手。

这触及到了多模态 AI 的核心。使用 “视觉模型”,意味着 ChatBox 这类工具正在从一个 “只能读文字的助手”,升级为一个 “既能读文字,也能看懂图片的助手”

简单来说:之前的嵌入模型和重排模型处理的是“语义”,而视觉模型处理的是“视觉”。前者理解“说的是什么”,后者理解“画的是什么”。

如果知识库里只有文字,用不上视觉模型。但如果知识库里包含图片、图表、截图、扫描件,那就必须引入视觉模型。原因如下:

视觉模型的工作方式(在 ChatBox 知识库中)

与嵌入模型类似,但处理的不是文本而是图像:

预处理(离线): - 知识库中的每张图片被送入视觉模型。 - 模型不仅仅提取特征向量,更重要的是生成对图片的详细描述(Captioning)或多模态嵌入向量(同时包含语义和视觉特征)。 - 这些描述/向量被存入知识库索引。

检索(在线): - 用户用文字提问:“这张电路图中哪个电阻看起来烧焦了?” - 系统先用嵌入模型理解你的问题,然后在知识库中检索相关的图片(通过之前生成的描述或向量)。 - 找到候选图片后,如果启用了多模态重排,会再用视觉模型精细比对问题与图片像素。

回答: - 将最相关的图片(或图片中的关键区域)和用户的问题一起发给大语言模型。现代的多模态大模型(如GPT-4V、Claude 3、Gemini)能直接理解图片内容,并生成文字答案。

什么时候需要选视觉模型?

  • 你的知识库中包含大量图片(产品目录、设计图、医疗影像、卫星图、监控截图)。
  • 你的知识库是扫描的PDF(旧书、合同、报表)。
  • 你需要用户能针对图表提问(销售数据分析、科学实验结果)。
  • 你的业务流程依赖视觉判断(质量检测、故障诊断、医学影像分析)。

总结:三层模型的关系

  • 嵌入模型:核心,必须。用于从海量文本中快速找到文字上相关的段落。
  • 重排模型:增强,可选但对精度提升大。用于对文本候选进行精细排序,提升准确率。
  • 视觉模型:扩展,仅在知识库有图片时需要。用于理解图片本身的像素信息,实现“看图说话”式问答。

一个简单判断标准:如果你希望用户能问“这个产品的颜色是?”(而不是“说明书写是什么颜色?”),或者问“图表里哪根柱子最高?”,那么你就需要开启视觉模型。如果你只有纯文本文档(如txt、md、纯文本PDF),则不需要。