> For the complete documentation index, see [llms.txt](https://lswkim322.gitbook.io/til/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://lswkim322.gitbook.io/til/til-ml/boostcamp/p-stage-klue/4-bert.md).

# (4강) 한국어 BERT 언어 모델 학습

> BERT를 직접 학습하는 강의

## 1. BERT 학습하기

### 2. BERT 모델 학습

1. Tokenizer 만들기
2. 데이터셋 확
   * 대용량의 Corpus Data가 필요함
3. Next sentence prediction (NSP)
4. Masking

도메인 특화 Task에서는  특화된 학습데이터만 사용하는 것이 성능이 더 좋다. 예를 들어 법률 Task와 같은 곳에서는 관련 학습데이터만 학습하는 것이 좋음.

![](https://3944465397-files.gitbook.io/~/files/v0/b/gitbook-legacy-files/o/assets%2F-MjcKlzGhHYe2bvmxTwS%2F-Mke5U9evwzhYx5ljgu8%2F-MkeUGIScHILY8av5YY6%2Fimage.png?alt=media\&token=57e85682-23a2-4c18-ae02-d3b449b9cf9f)

* 화학 관련 Task도 Pre-trained 모델을 사용하는 것보다 새로 학습시키는 것이 더 좋다.

#### 우선 학습을 위한 데이터를 만들어야 한다. (데이터셋 만들기)

![](https://3944465397-files.gitbook.io/~/files/v0/b/gitbook-legacy-files/o/assets%2F-MjcKlzGhHYe2bvmxTwS%2F-Mke5U9evwzhYx5ljgu8%2F-MkeWJ2w2OWU_S4HjSye%2Fimage.png?alt=media\&token=514b7b52-ded1-4eeb-bdb1-501593b809d7)

모델의 입력으로 만들기 위한 Dataset을 만드는 것과 모델에게 Dataset을 어떻게 전달하는지를 담당하는 Dataloader가 있다.

![](https://3944465397-files.gitbook.io/~/files/v0/b/gitbook-legacy-files/o/assets%2F-MjcKlzGhHYe2bvmxTwS%2F-Mke5U9evwzhYx5ljgu8%2F-MkeXTjuTqyk7bfCzykA%2Fimage.png?alt=media\&token=6865c0b5-3495-4007-8faa-82db4b15a935)

## 실습코드 Link

{% embed url="<https://drive.google.com/file/d/1yg2HZQbc-0KVINClp-U_i40tC6mIyGVW/view?usp=sharing>" %}

{% embed url="<https://drive.google.com/file/d/1A5M5lCI7JlB1qzJHLcz8hg325p1tS0d_/view?usp=sharing>" %}
