Writing

Notes, and things drawn out.

Logs from building the tools - mostly what went wrong and what it cost - and guides that take something invisible and put it on the page. Some posts are in English, some in Korean; the language is marked on each. RSS

Series

재귀와 합성곱

13 parts

어텐션 전에 있던 것들을 하나씩 열어 본다. 재귀 한 걸음이 실제로 하는 계산, 게이트가 무엇을 여닫는지, 합성곱 커널이 어디를 보는지, 풀링이 무엇을 버리는지 - 그리고 마지막에 같은 예산으로 붙여 본다.

  1. 01 재귀 한 걸음이 하는 계산 EN
  2. 02 게이트를 꺼내 보니 망각 게이트가 안 움직였다 EN
  3. 03 게이트 하나를 없앤 쪽이 이겼다 EN
  4. 04 첫 층 커널이 배운 것은 줄 끝이었다 EN
  5. 05 창을 공짜로 넓혔더니 나빠졌다 EN
  6. 06 풀링은 위치 3비트를 버린다 EN
  7. 07 같은 예산이면 GRU 가 이긴다 - 700걸음 동안만 EN
  8. 08 기울기를 멀리 보내면 손실이 나빠졌다 EN
  9. 09 걸음으로 견준 것이 트랜스포머에 유리했다 EN
  10. 10 과제를 바꾸니 순서가 뒤집혔다 EN
  11. 11 어디서부터 못 하나 EN
  12. 12 층을 쌓아도 안 늘었다 EN
  13. 13 얕은 스택은 상한을 다 쓴다 EN

훈련이 끝난 뒤

13 parts

학습이 끝난 모델을 실제로 돌릴 때 붙는 것들을 잰다. 다음 글자를 고르는 규칙, 두 번 계산하지 않는 법, 정밀도를 버리고 남는 것 - 앞 시리즈에서 만든 모델을 그대로 쓴다.

  1. 01 모델은 다음 글자를 고르지 않는다 EN
  2. 02 같은 계산을 n 번 반복하고 있었다 EN
  3. 03 가중치를 4분의 1로 줄이면 무엇이 사라지나 EN
  4. 04 초안이 좋을수록 느려졌다 EN
  5. 05 배치 하나에 96%가 낭비였다 EN
  6. 06 캐시를 자르면 맨 앞을 남겨야 한다 EN
  7. 07 읽는 글자와 쓰는 글자의 값이 40배 다르다 EN
  8. 08 0을 아무리 많이 만들어도 빨라지지 않는다 EN
  9. 09 패딩 낭비는 배치 문제가 아니었다 EN
  10. 10 빈 자리를 채웠더니 캐시가 길어졌다 EN
  11. 11 메모리를 1.6배 아끼고 시간을 1.7배 잃었다 EN
  12. 12 프리필을 세니 1.56배가 1.22배가 됐다 EN
  13. 13 꼬리를 재니 12편의 k=8 이 47% 나쁘다 EN

보이는 딥러닝

13 parts

딥러닝 기초를 그림으로 다시 본다. 매 편이 눈에 안 보이던 것 하나 - 메모리 위의 텐서, 손실 지형 위의 한 걸음, 그래프를 거슬러 흐르는 미분 - 를 그려서 확인한다.

  1. 01 텐서는 사실 1차원이다 EN
  2. 02 학습률에는 넘으면 안 되는 선이 있다 EN
  3. 03 역전파는 장부다 EN
  4. 04 20층을 쌓으면 기울기가 사라진다 EN
  5. 05 미니배치는 왜 더 시끄러운데 더 빨리 도착하나 EN
  6. 06 정규화는 초기값을 지운다 EN
  7. 07 훈련 오차를 0으로 만드는 법과 그 대가 EN
  8. 08 어텐션 가중치를 직접 꺼내 본다 EN
  9. 09 위치 인코딩은 순서를 어떻게 집어넣나 EN
  10. 10 머리를 여덟으로 쪼개면 무엇이 달라지나 EN
  11. 11 파라미터의 3분의 2가 있는 층 EN
  12. 12 블록을 96개 쌓아 보면 무엇이 무너지나 EN
  13. 13 63만 개짜리로 글자를 예측해 본다 EN

Everything else