파이썬을 활용한 기초통계 분석
Python과 VS Code를 설치하고 pandas로 데이터를 불러와 기초통계를 내는 실습 매뉴얼이다. Python이 처음이면 여기부터 본다.
새 탭에서 열기 ↗문서 1Nemotron-Personas-Korea 이해 보고서
데이터가 어떻게 만들어졌는지, 26개 컬럼이 어떤 분포인지, 서술문은 어떤 모습인지 정리했다. Hugging Face 버전과 NGC 확장 버전의 차이도 여기에 있다.
읽기 →문서 2SDG-PGMs 미국 예제(us_person) 읽기
NVIDIA가 공개한 확률적 그래프 모델 프레임워크의 미국 인물 생성 예제를 코드로 읽었다. 변수 29개가 어떤 순서로, 무엇을 조건으로 뽑히는지 표로 옮겼다.
읽기 →문서 3입문 실습: 표본으로 시작하기
내려받기 없이 시작한다. 사이트에 올려 둔 표본(1만 명, 직무별 7,500명)을 pandas로 열어 기초통계를 내고, 내 학과와 관련된 직무를 골라 다른 직무와 비교한다. 1차시를 마친 사람이 대상이다.
노트북 파일: notebooks/00_beginner.ipynb · pandas읽기 →문서 4입문 실습에 나온 pandas 기초 문법
입문 노트북의 셀을 차례로 따라가며 나온 문법을 설명했다. 결측치 세기, 행 거르기, 교차표, groupby, 서술문의 낱말 세기까지 다룬다.
읽기 →문서 5실습: 불러오기, 기초통계, 직무별로 보기
Hugging Face에서 데이터를 받아 기초통계를 내고, 직업명으로 직무 집단을 골라 취업자 전체와 비교한다. 실행 결과가 함께 들어 있다.
노트북 파일: notebooks/01_hf_quickstart.ipynb · 전체 데이터 2GB 필요읽기 →문서 6실습 노트북에 나온 Python 기초 문법
노트북을 읽는 데 필요한 문법만 골라 실제 코드로 설명했다. 1차시에서 쓴 pandas가 아니라 polars를 쓴 이유와 두 라이브러리의 대응표가 있다.
읽기 →노트북 원본: 00_beginner.ipynb (입문, pandas) · 01_hf_quickstart.ipynb (확장, polars). 표본 파일의 구성과 규칙은 표본 설명에 있다.