아카이브
자료의 형식은 달라도, 필요한 맥락을 한곳에서 찾습니다.
RAG 평가에서 가장 먼저 고정해야 할 기준은 무엇일까요?
정답 데이터셋을 만들기 전에 팀이 먼저 합의해야 할 관찰 기준이 궁금합니다.
평균과 중앙값의 차이가 큰 경우, 보고서에서 어떻게 설명하시나요?
이상치가 있다는 말만으로는 충분하지 않은 것 같아 문장 예시를 찾고 있습니다.
작은 개인 프로젝트의 첫 화면은 어디까지 설명해야 할까요?
서비스 소개와 실제 기능 화면 사이에서 균형을 잡기 어렵습니다.
에이전트에게 맥락을 전달하는 가장 작은 단위
Research Desk 영상 강의
학습률을 읽는 작은 실험실
수식, 그래프, 영상으로 경사하강법의 속도와 안정성을 함께 살펴보는 테스트 아티클.
RAG를 제품 화면으로 설계할 때 남는 질문들
Product Notes 영상 강의
프롬프트를 문서가 아니라 작업 흐름으로 다루기
Workflow Lab 영상 강의
평가 가능한 AI 기능의 최소한의 기준
Research Desk 영상 강의
개인 지식 시스템 안에서 작동하는 AI 에이전트
PKP Field Notes 영상 강의
데이터·변수·표본의 언어
데이터의 행은 관측 단위, 열은 변수다. 분석 전에 관측 단위·기간·식별자를 정해야 중복과 시간 단위 혼동을 막는다. 명목·순서·등간·비율척도는 허용하는 비교가 다르며, 숫자로 저장된 만족도도 순서형일 수 있다. 기술통계는 표본을 요약하고 추론통계는 표본오차와 가정 아래 모집단에 관해 말한다.
일변량 기술통계
일변량 탐색은 전형적인 값뿐 아니라 흩어짐·꼬리·봉우리·빈 구간을 묻는다. 평균은 극단값에 민감하고 중앙값은 치우친 분포에서 더 안정적일 수 있다. 표준화는 단위가 다른 변수의 상대 위치를 비교하는 변환이며 큰 z점수는 오류가 아니라 검토 후보를 뜻한다.
EDA와 변수 관계
EDA는 모델 전에 자료 패턴과 품질 문제를 탐색한다. 수치-수치는 산점도, 범주-범주는 교차표, 범주-수치는 그룹별 분포가 출발점이다. 상관계수는 선형 관계 요약일 뿐 비선형 관계·인과관계의 증거가 아니므로 시간 순서·공통 원인을 점검한다.
분석용 데이터 준비
전처리는 빈칸을 기계적으로 채우는 일이 아니라 결측 이유·오류·관측 불가능을 구분하는 일이다. 거리 기반 모델은 단위가 큰 변수를 더 중요하게 보므로 스케일링이 중요하다. 대치·스케일링·범주 목록·변수 선택은 학습 자료에서만 적합한 뒤 평가 자료에 적용해야 한다.
확률의 기초
표본공간은 가능한 결과의 집합, 사건은 그 일부다. 독립은 P(A∩B)=P(A)P(B)가 성립하는 엄격한 관계다. 베이즈 정리는 검사 결과에서 실제 상태 확률로 방향을 바꾸며 민감도뿐 아니라 기저율을 반영한다.
확률분포와 요약량
확률분포는 가능한 값과 불확실성을 기술한다. 이산형은 특정 값 확률을 더하고 연속형은 구간 아래 면적으로 해석한다. 이항은 독립 성공 횟수, 포아송은 구간 사건 수, 정규는 대칭 연속 변동의 대표 모형이며 이름보다 조건을 확인한다.
표본분포와 추정
반복 표본추출로 얻은 평균들의 분포가 표본분포다. 표준오차는 추정량의 표본 간 흔들림으로 원자료 표준편차와 다르다. 95% 신뢰구간은 같은 절차를 반복할 때 만들어진 구간의 약 95%가 고정된 모수를 포함한다는 성질이다.
가설검정의 원리
가설검정은 H0 아래 관측 결과가 얼마나 이례적인지 평가한다. p값은 H0가 참일 때 관측값 이상으로 극단적인 결과의 확률이지 H0가 참일 확률이 아니다. p가 크면 H0를 채택하는 것이 아니라 현재 설계에서 기각할 충분한 증거가 없다고 말한다.
검정 선택과 해석
검정 선택은 이름보다 질문 구조에서 시작한다. 두 독립 평균에는 독립 t, 같은 사람 전후에는 대응 t, 세 집단 이상에는 ANOVA, 범주형 관련성에는 카이제곱을 고려한다. 정규성·등분산성·독립성은 결과 뒤에 붙이는 장식이 아니다.
회귀분석 기초
선형회귀는 입력 가중합으로 연속형 결과를 설명·예측한다. 다중회귀 계수는 다른 변수를 고정한다는 조건 아래의 변화다. 잔차 곡선·깔때기·영향점은 가정 문제를 시사하며 R²가 높아도 외삽·인과 설명은 보장되지 않는다.
모델링 실험 설계와 평가
모델 선택은 보지 않은 자료 일반화 성능을 추정하는 실험이다. 교차검증의 각 폴드 학습 부분에서만 대치·스케일링·변수 선택·리샘플링을 적합한다. 테스트셋은 선택이 끝난 뒤 한 번만 최종 보고에 사용하며, 불균형 자료에서는 정확도 대신 오류 비용에 맞는 지표를 본다.
지도학습: 선형 분류와 거리 기반 방법
지도학습은 입력과 레이블 쌍으로 새 입력을 예측한다. 로지스틱 회귀는 선형 점수를 확률처럼 변환하고, K-NN은 거리와 스케일에 민감하며, SVM은 여백이 큰 경계를 찾는다. 분류 임계값 0.5는 자연법칙이 아니라 오류 비용에 따른 의사결정 값이다.
트리와 앙상블
나무는 규칙을 반복 적용해 더 균질한 부분으로 나눈다. 깊은 나무는 학습 자료를 외워 일반화가 나빠질 수 있다. 배깅은 분산을 줄이고, 랜덤포레스트는 변수 무작위화도 쓰며, 부스팅은 앞 모델 오류에 순차 집중한다.
비지도학습과 차원 축소
비지도학습은 레이블 없이 구조를 탐색한다. 군집화는 관측치를 묶고 PCA는 변수를 적은 직교 축으로 요약한다. PCA 좌표는 군집 레이블이 아니다. K-평균은 거리 단위에 민감하고, PCA 첫 성분은 가장 큰 분산 방향일 뿐 가장 중요한 원인을 뜻하지 않는다.
신경망과 딥러닝 기초
신경망 층은 가중합·편향 뒤 비선형 활성화를 적용한다. 비선형성이 없으면 여러 층도 하나의 선형변환과 같다. 역전파는 손실의 가중치별 민감도를 계산하고 경사하강은 반대 방향으로 갱신한다. CNN은 공간 구조, RNN 계열은 순서 구조가 중요한 자료에 적합할 수 있다.
고급 데이터: 시계열·텍스트·시공간
시계열은 순서가 정보다. 추세는 장기 변화, 계절성은 주기 반복, 자기상관은 과거와 현재 관계다. 무작위 분할은 미래 정보를 학습으로 섞을 수 있다. 텍스트는 수치화하면서 문맥 손실이 생기고, 시공간 자료는 이웃 의존성 때문에 임의 행 분할을 경계한다.
모형 개선·결과 해석·시각화
너무 단순하면 신호를 놓치고 너무 유연하면 잡음까지 따라간다. 정규화는 큰 계수에 벌점을 주어 복잡도를 제어하며 초매개변수는 교차검증으로 선택한다. 테스트셋은 마지막 독립 평가에 한 번만 쓰고, 결과를 보고 재튜닝하면 새 테스트셋이 필요하다.
통합 분석 워크플로
좋은 분석은 알고리즘보다 질문에서 시작한다. 집단 차이 추론·미래 예측·구조 탐색 중 무엇인지 정하고 관측 단위·목표·오류 비용을 설계한다. 통계검정은 모집단 차이 증거를, 머신러닝 평가는 보지 않은 자료 예측을 다루므로 한 결과를 다른 목적의 증거로 바꾸지 않는다.
통계·머신러닝 용어집
이 용어집은 단어 번역뿐 아니라 정의, 인접 개념과의 경계, 해석상 주의점을 함께 제공한다. 장 본문의 첫 등장에서는 한국어와 영어를 병기하고, 여기서는 복습과 교차 참조에 사용한다.
도구 호출 경험을 망치지 않는 인터페이스
Product Notes 영상 강의
Median Lab
데이터 포인트를 옮기며 평균과 중앙값의 차이를 직접 확인하는 작은 실험.
데이터 글쓰기 루틴
분석 기록을 타인도 다시 읽을 수 있는 글로 바꾸는 편집의 순서.
Prompt Card Sort
프롬프트의 역할을 입력, 제약, 검토로 정렬해 보는 카드 도구.
조용한 인터페이스가 남기는 정보
많이 말하지 않는 화면이 더 오래 쓰이는 이유에 대하여.
Knowledge Ops Dashboard
학습과 기록의 상태를 한 화면에서 읽는 개인 운영 도구.
SQL Timeline
윈도 함수의 프레임이 움직이는 방식을 한 줄씩 보여 주는 설명 노트.
Topic Graph Viewer
문서의 관계를 그래프로 탐색하는 지식 시각화 실험.
작은 모델, 큰 작업 흐름
도구 선택보다 먼저 고정해야 하는 입력과 검토의 구조.
Distribution Shelf
분포의 모양을 고르고 대표값의 변화를 비교하는 미니 시뮬레이터.
Metric Room
팀이 같은 숫자를 다른 장면에서 읽지 않도록 만드는 지표 공간.
거리에서 보는 대시보드
운영 화면에 필요한 것은 더 많은 지표가 아니라 읽는 순서다.
현장에서 수집한 작은 질문들
프로젝트를 진행하며 사라지기 전에 적어 둔 열두 개의 메모.
Writing Index
작업 중인 글과 참고 기록을 연결하는 개인 편집 도구.
배움을 공개하는 일의 밀도
완성본이 아닌 중간 기록을 다루는 태도.