Axıs
目录

RAG

流式数据渲染的方法

基于生产者-消费者模型,后端生产,前端消费

  • 基于WS协议

  • SSE(Server-Sent Event):

    • 消费端监听 & 生产端生产:前端监听数据,维护对象或者数组,当接收的流开始变化时进行逐步渲染

      问题:
          前端可能需要数据过滤
          代码相对比较复杂
      
    • 消费端拉 & 生产端推:后端维护一个数组,每次yield返回;前端维护一个缓存,每次shift()拉

      问题:
          如果消费端拉得太快,数组可能空
          拉得太慢,数组可能堆积
      解决方法:
          异步队列
      

RAG应用中处理表格类数据时为什么会效果不佳

表格类数据的特点:结构化、文本信息分散、上下文关联性弱。

similarity_search不佳的原因:表格中的内容缺少丰富的自然语言上下文,导致向量化时信息不足。

rerank效果差的原因rerank模型通常依赖于完整的自然语言句子或段落,表格中的数据可能语义不连贯、缺少足够的文本信息来进行排序。

生活类比

表格类数据像是一份分类目录,里面的条目简短、具体,提供的上下文信息非常有限。如果你问一个问题,而得到的答案只有一些数值或短语,理解起来就会变得困难。同样的,模型在处理这些数据时,也会因信息不足而表现不佳。