EmbeddingGemma 2와 LAYA의 Retrieve–Rerank 구조를 직접 실험해봤다
·
관심있는 주제/탐구 노트
LAYA 한국어 민원 분류 2편: EmbeddingGemma 2 검색을 붙이면 좋아질까 27개 유형에서 막힌 LAYA 앞에 의미 검색기를 놓고, 새 유형까지 실제로 다시 측정했다.1편의 결론은 불편했다. 민원 유형 설명을 잘 작성하고 LAYA를 추가 학습해도 27개 소분류를 한 번에 고른 정확도는 34.6%(28/81)였다. 대→중→소 순차 분류는 23.5%, top-k 계층 후보를 12개 남긴 beam 방식은 정답 후보를 76.5% 보존했지만 최종 정확도가 8.6%였다. 후보를 만드는 규칙과 최종 LAYA 판별이 모두 흔들렸다.이번에는 사용자가 제안한 EmbeddingGemma 2를 검색기로 붙였다. 명칭은 ‘Embedding Gamma’가 아니라 Google DeepMind의 Embeddin..