moka 二面面试
知识库里的向量数据从哪里来(原始文档、结构化表、日志等)?
你的 Chunking 具体怎么切(规则、窗口、重叠、元数据)?
如果重做一套 RAG:有哪些你认可的分块最佳实践(窗口大小等)?
父子分块(大块+小块)怎么落地:长文档的大块如何切分与对齐?
固定长度切分如何减少语义割裂(重叠、按结构切、语义边界等)?