사이오닉에이아이가 검색 임베딩 모델 'comsat-embed'의 한국어·일본어 버전을 개발해 공개했다. 이 모델은 질문과 문서를 수치화해 연관성 높은 자료를 선별하는 검색 임베딩 모델로, MTEB(Massive Text Embedding Benchmark) 검색 평가에서 비교 대상 중 최고 평균 점수를 기록했다.
한국어 8B 모델, Qwen3·Harrier-OSS 제쳐
한국어 8B 모델 'comsat-embed-ko-8b-preview'는 MTEB 한국어 검색 영역 9개 데이터셋 평균 NDCG@10에서 79.30을 기록했다. 같은 평가에서 알리바바의 'Qwen3-Embedding-8B'는 78.25, 마이크로소프트의 27B 모델 'Harrier-OSS-v1-27B'는 76.69에 그쳤다.
| 모델 | 개발사 | NDCG@10 |
|---|---|---|
| comsat-embed-ko-8b-preview | 사이오닉에이아이 | 79.30 |
| Qwen3-Embedding-8B | 알리바바 | 78.25 |
| Harrier-OSS-v1-27B | 마이크로소프트 | 76.69 |

일본어 모델, 대형·소형 모두 상위권
일본어 8B 모델 'comsat-embed-ja-8b-preview'는 MTEB 일본어 검색 영역 11개 데이터셋 평균 NDCG@10 81.33을 기록했다. 파라미터 3억개 규모의 경량 모델 'comsat-embed-ja-0.3b-preview'도 NDCG@10 77.85를 기록해 4B 이하 비교 모델 중 선두에 올랐다.
실제 검색 환경 반영한 학습 방식
comsat-embed는 짧은 키워드부터 장문까지, 질문과 문서 간 1대다·다대1 관계까지 포함한 실제 검색 환경의 다양한 형태를 학습에 반영했다. 여기에 하드 네거티브 마이닝과 지식 증류 방식을 적용해 특정 데이터셋에 편중되지 않고 전체적으로 고른 성능 개선을 추구했다.
이 모델은 언어·도메인·질문 형태가 달라져도 안정적인 검색 성능을 구현하는 것을 목표로 하는 EUREKA 프로젝트의 결과물이다. 현재 허깅페이스에 프리뷰 버전으로 공개돼 있으며, 실제 기업 데이터와 복합 질문 환경에서도 동일한 성능이 재현되는지가 다음 검증 과제로 남아 있다.