KcBERT: Korean comments BERT Updates on 2021.04.07 KcELECTRA가 릴리즈 되었습니다!🤗 KcELECTRA는 보다 더 많은 데이터셋, 그리고 더 큰 General vocab을 통해 KcBERT 대비 모든 태스크에서 더 높은 성능 을 보입니다. 아래 깃헙 링크에서 직접 사용해보세요! https://github.com/Beomi/KcELECTRA Updates on 2021.03.14 KcBERT Paper 인용 표기를 추가하였습니다.(bibtex) KcBERT finetune Performance score를 본문에 추가하였습니다. Updates on 2020.12.04 Huggingface Transformers가 v4.0.0으로 업데이트됨에 따라 Tutorial의 코드가 일부 변경되었습니다. 업데이트된 KcBERT Large NSMC Finetuning Colab: Updates on 2020.09.11 KcBERT를 Google Colab에서 TPU를 통해 학습할 수 있는 튜토리얼을 제공합니다! 아래 버튼을 눌러보세요. Colab에서 TPU로 KcBERT Pretrain 해보기: 텍스트 분량만 전체 12G 텍스트 중 일부(144MB)로 줄여 학습을 진행합니다. 한국어 데이터셋/코퍼스를 좀더 쉽게 사용할 수 있는 Korpora 패키지를 사용합니다. Updates on 2020.09.08 Github Release를 통해 학습 데이터를 업로드하였습니다. 다만 한 파일당 2GB 이내의 제약으로 인해 분할압축되어있습니다. 아래 링크를 통해 받아주세요. (가입 없이 받을 수 있어요. 분할압축) 만약 한 파일로 받고싶으시거나/Kaggle에서 데이터를 살펴보고 싶으시다면 아래의 캐글 데이터셋을 이용해주세요. Github릴리즈: https://github.com/Beomi/KcBERT/releases/tag/TrainData v1 Updates on 2020.08.22 Pretrain Dataset 공개 캐글: https://www.kaggle.com/junbumlee/kcbert pretraining corpus korean news comments (한 파일로 받을 수 있어요. 단일파일) Kaggle에 학습을 위해 정제한(아래 clean 처리를 거친) Dataset을 공개하였습니다! 직접 다운받으셔서 다양한 Task에 학습을 진행해보세요 :) 공개된 한국어 BERT는 대부분…
We use cookies for essential functionality and analytics. You can accept or reject analytics cookies.Cookie policy