Korean Reranker Training on Amazon SageMaker 한국어 Reranker 개발을 위한 파인튜닝 가이드를 제시합니다. ko reranker는 BAAI/bge reranker larger 기반 한국어 데이터에 대한 fine tuned model 입니다. 보다 자세한 사항은 korean reranker git / AWS Blog, 한국어 Reranker를 활용한 검색 증강 생성(RAG) 성능 올리기을 참고하세요 0. Features Reranker는 임베딩 모델과 달리 질문과 문서를 입력으로 사용하며 임베딩 대신 유사도를 직접 출력합니다. Reranker에 질문과 구절을 입력하면 연관성 점수를 얻을 수 있습니다. Reranker는 CrossEntropy loss를 기반으로 최적화되므로 관련성 점수가 특정 범위에 국한되지 않습니다. 1.Usage using Transformers using SageMaker 2. Backgound 컨택스트 순서가 정확도에 영향 준다 (Lost in Middle, Liu et al., 2023 ) Reranker 사용해야 하는 이유 현재 LLM은 context 많이 넣는다고 좋은거 아님, relevant한게 상위에 있어야 정답을 잘 말해준다 Semantic search에서 사용하는 similarity(relevant) score가 정교하지 않다. (즉, 상위 랭커면 하위 랭커보다 항상 더 질문에 유사한 정보가 맞아?) Embedding은 meaning behind document를 가지는 것에 특화되어 있다. 질문과 정답이 의미상 같은건 아니다. (Hypothetical Document Embeddings) ANNs(Approximate Nearest Neighbors) 사용에 따른 패널티 3. Reranker models [Cohere] Reranker [BAAI] bge reranker large [BAAI] bge reranker base 4. Dataset msmarco triplets (Question, Answer, Negative) Triplets from MS MARCO Passages dataset, 499,184 samples 해당 데이터 셋은 영문으로 구성되어 있습니다. Amazon Translate 기반으로 번역하여 활용하였습니다. Format Query는 질문이고, pos는 긍정 텍스트 목록, neg는 부정 텍스트 목록입니다. 쿼리에…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy