Nemotron Personas Korea ========================================================================= 우리나라 실제 분포에 기반한 합성 페르소나를 위한 복합 AI 시스템 A compound AI approach to personas grounded in real world distributions 데이터셋 개요 (Overview) Nemotron Personas Korea는 대한민국의 실제 인구통계학적·지리적·성격 특성 분포를 기반으로 합성된 오픈소스 페르소나 데이터셋(CC BY 4.0)으로, 우리나라 인구의 다양성과 특성을 폭넓게 반영하도록 설계되었습니다. 이는 최초의 대규모 우리말 페르소나 데이터셋이며, 이름, 성별, 나이, 혼인 상태, 교육 수준, 직업, 거주 지역 등의 속성을 실제 대한민국 통계청(KOSIS), 대법원, 국민건강보험공단, 농촌경제연구원, NAVER Cloud 통계 자료를 기반으로 합성하였습니다. Nemotron Personas Korea는 대한민국의 모델 개발자가 지역 고유의 인구통계학적 특성과 문화적 맥락을 반영한 소버린 AI(Sovereign AI) 시스템을 구축할 수 있도록 지원합니다. 이 데이터셋은 소버린 AI 모델 개발을 위한 합성 데이터의 다양성 확대, 데이터 및 모델 편향 완화, 그리고 모델 응답의 다양성 향상 등에 활용될 수 있습니다. 특히 기존 페르소나 데이터셋 대비 나이(예: 고령층), 지역(예: 농촌), 교육 수준, 직업 등 다양한 축에서 실제 인구 분포를 보다 충실히 반영하도록 설계하였습니다. 본 데이터셋은 엔터프라이즈급 합성 데이터 생성 복합 AI 시스템인 NeMo Data Designer를 사용하여 제작되었으며, 독자적인 확률적 그래프 모델(PGM)과 Apache 2.0 라이선스인 google/gemma 4 31B it 모델, 그리고 Data Designer에 포함된 검증 및 평가 방법을 활용했습니다. NeMo Data Designer에서 직접 사용할 수 있는 Nemotron Personas Korea의 확장 버전도 제공됩니다. 이 데이터셋은 상업적 및 비상업적 용도로 모두 자유롭게 사용할 수 있습니다. – Nemotron Personas Korea is an open source persona dataset (CC BY 4.0) synthesized based on real world de…
Runs entirely in your browser via DuckDB-Wasm — this dataset's real data file is loaded once, then queried locally. Nothing is sent to a server.
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy