AWS가 만든 완전관리형 머신러닝 플랫폼 Amazon SageMaker AI가 무엇을 하고, 2024년 개명 이후 더 큰 SageMaker 플랫폼 안에서 어떤 자리를 차지하는지 정리한다.
오픈소스 AI 모델·데이터셋·데모 앱을 한곳에 모아 두는 허브 Hugging Face Hub의 구조를 정리한다. 2백만 개 넘는 모델과 백오십만 개 데이터셋이 어떻게 한 플랫폼 위에서 굴러가는지, 그리고 이 회사가 왜 "커뮤니티 중심"을 반복해서 내세우는지 짚는다.
AWS가 수천 개의 AI 가속기를 하나의 클러스터로 묶어 대규모 모델 훈련·추론을 관리하는 상품 SageMaker HyperPod의 장애 복구·자원 배분 구조와 최근 추론 최적화 확장을 정리한다.
왜 기계학습 및 여러 시스템에서 노이즈를 모델링할 때 정규분포를 선택하는가? 그게 제일 합리적이라서. 첫째로 모형화하고자 하는 분포중에는 Normal Distribution에 가까운 것들이 많다.
정규 분포 실제로 가장 많이 적용되는 분포는 이항 분포이다. 하지만 이는 이산 확률 변수에 대해 정의되는 변수이다. 이번에는 연속 확률 분포들 중에서 대부분의 통계학 이론의 기본이 되는 정규분포에 대해서 공부한다.
다변수 확률 분포의 복잡성 기계 학습 알고리즘을 확률 분포로 생각해보자. 굉장히 많은 확률 변수가 관여함에도, 비교적 적은 수의 변수들만 서로간의 직접적인 상호작용을 갖는다. 즉, 대부분은 독립적인 확률변수이고, 몇몇만 종속적이다.