聚焦大模型应用中视觉信息处理与检索增强生成的技术突破与架构演进。
Alinhamento Vetorial entre Visão e Texto;Independência de Resolução dos Modelos Grandes Multimodais;Compressão Espaço-Temporal de Tokens de Vídeo vs. Sequência em Espeto
Segmentação semântica vs Granularidade fina;RAG sem vetores vs RAG vetorial