모든 언어, 같은 정확도.
사용자가 日本語, 中文, Español, English 무엇으로 적어도 검색 품질이 동일합니다. 저장 언어와 질문 언어를 교차한 70개 조합을 격자로 만들어 재고, 그 숫자를 공개합니다. recall@5 95.2%입니다.
여러 언어를 섞어 쓰는 저장소는 검색 품질이 아무도 모르게 무너지는 자리입니다. 같은 질문인데 그 기억이 어떤 언어로 적혔느냐에 따라 점수가 달라집니다. 저희는 그것을 한계가 아니라 결함으로 보고, 언어쌍 전체를 격자로 만들어 측정합니다.
한 저장소에 세 언어를 동시에
저장소마다 언어를 정할 필요가 없습니다 - 자유롭게 섞으세요. 아래는 한 사용자의 기억에 일본어·영어·스페인어가 동시에 들어있고, 어떤 언어로 묻든 맞는 기억을 찾아오는 모습입니다. 라이브 API에서 실제로 주고받은 내용입니다:
# one user, three languages stored together mem.add("彼女はコーヒーより紅茶が好き", user_id="alice") # Japanese mem.add("she works at a design studio in Brooklyn", user_id="alice") # English mem.add("A ella le encanta hacer senderismo los sábados", user_id="alice") # Spanish
실제 결과 - 질문마다 다른 언어의 기억을 찾아냄
"¿Qué bebe ella?" -> 彼女はコーヒーより紅茶が好き "what does she do on weekends?" -> A ella le encanta hacer senderismo los sábados "彼女の仕事は?" -> she works at a design studio in Brooklyn
번역 단계도, 언어 감지도, 언어별 설정도 없습니다. 기억과 질문은 언어가 아니라 의미로 배치됩니다 - 맥락과 의미만 같으면 언어가 달라도 찾아냅니다.
여기 세 언어는 지면에 맞춘 것일 뿐 - 애초에 "지원 언어 목록"이라는 게 없습니다. 같은 라이브 테스트가 中文·Русский·العربية 기억으로도 통과했고, 전부 운영 API에서 실측한 것입니다.
한 언어가 다른 언어를 이기면 안 되는 이유
다른 모든 조정보다 위에 두는 규칙이 하나 있습니다. 검색 품질이 기억을 적은 언어에 좌우되어서는 안 된다는 것입니다. 70개 언어쌍으로 측정하고 코드 리뷰에서 강제하며, 한 언어를 다른 언어의 희생으로 끌어올리는 것은 출시하지 않습니다.
LongMemEval은 영어 전용이라 다국어 검색 품질은 측정하지 않습니다. 다국어는 위 데모처럼 라이브 API에서 직접 확인할 수 있습니다.