43 results

Jeogiyo · 대화

RAG 평가에서 가장 먼저 고정해야 할 기준은 무엇일까요?

정답 데이터셋을 만들기 전에 팀이 먼저 합의해야 할 관찰 기준이 궁금합니다.

Jeogiyo · 대화

평균과 중앙값의 차이가 큰 경우, 보고서에서 어떻게 설명하시나요?

이상치가 있다는 말만으로는 충분하지 않은 것 같아 문장 예시를 찾고 있습니다.

Jeogiyo · 대화

작은 개인 프로젝트의 첫 화면은 어디까지 설명해야 할까요?

서비스 소개와 실제 기능 화면 사이에서 균형을 잡기 어렵습니다.

Gen AI · 영상

에이전트에게 맥락을 전달하는 가장 작은 단위

Research Desk 영상 강의

Blog ·

학습률을 읽는 작은 실험실

수식, 그래프, 영상으로 경사하강법의 속도와 안정성을 함께 살펴보는 테스트 아티클.

Gen AI · 영상

RAG를 제품 화면으로 설계할 때 남는 질문들

Product Notes 영상 강의

Gen AI · 영상

프롬프트를 문서가 아니라 작업 흐름으로 다루기

Workflow Lab 영상 강의

Gen AI · 영상

평가 가능한 AI 기능의 최소한의 기준

Research Desk 영상 강의

Gen AI · 영상

개인 지식 시스템 안에서 작동하는 AI 에이전트

PKP Field Notes 영상 강의

Stat & ML · 학습 노트

데이터·변수·표본의 언어

데이터의 행은 관측 단위, 열은 변수다. 분석 전에 관측 단위·기간·식별자를 정해야 중복과 시간 단위 혼동을 막는다. 명목·순서·등간·비율척도는 허용하는 비교가 다르며, 숫자로 저장된 만족도도 순서형일 수 있다. 기술통계는 표본을 요약하고 추론통계는 표본오차와 가정 아래 모집단에 관해 말한다.

Stat & ML · 학습 노트

일변량 기술통계

일변량 탐색은 전형적인 값뿐 아니라 흩어짐·꼬리·봉우리·빈 구간을 묻는다. 평균은 극단값에 민감하고 중앙값은 치우친 분포에서 더 안정적일 수 있다. 표준화는 단위가 다른 변수의 상대 위치를 비교하는 변환이며 큰 z점수는 오류가 아니라 검토 후보를 뜻한다.

Stat & ML · 학습 노트

EDA와 변수 관계

EDA는 모델 전에 자료 패턴과 품질 문제를 탐색한다. 수치-수치는 산점도, 범주-범주는 교차표, 범주-수치는 그룹별 분포가 출발점이다. 상관계수는 선형 관계 요약일 뿐 비선형 관계·인과관계의 증거가 아니므로 시간 순서·공통 원인을 점검한다.

Stat & ML · 학습 노트

분석용 데이터 준비

전처리는 빈칸을 기계적으로 채우는 일이 아니라 결측 이유·오류·관측 불가능을 구분하는 일이다. 거리 기반 모델은 단위가 큰 변수를 더 중요하게 보므로 스케일링이 중요하다. 대치·스케일링·범주 목록·변수 선택은 학습 자료에서만 적합한 뒤 평가 자료에 적용해야 한다.

Stat & ML · 학습 노트

확률의 기초

표본공간은 가능한 결과의 집합, 사건은 그 일부다. 독립은 P(A∩B)=P(A)P(B)가 성립하는 엄격한 관계다. 베이즈 정리는 검사 결과에서 실제 상태 확률로 방향을 바꾸며 민감도뿐 아니라 기저율을 반영한다.

Stat & ML · 학습 노트

확률분포와 요약량

확률분포는 가능한 값과 불확실성을 기술한다. 이산형은 특정 값 확률을 더하고 연속형은 구간 아래 면적으로 해석한다. 이항은 독립 성공 횟수, 포아송은 구간 사건 수, 정규는 대칭 연속 변동의 대표 모형이며 이름보다 조건을 확인한다.

Stat & ML · 학습 노트

표본분포와 추정

반복 표본추출로 얻은 평균들의 분포가 표본분포다. 표준오차는 추정량의 표본 간 흔들림으로 원자료 표준편차와 다르다. 95% 신뢰구간은 같은 절차를 반복할 때 만들어진 구간의 약 95%가 고정된 모수를 포함한다는 성질이다.

Stat & ML · 학습 노트

가설검정의 원리

가설검정은 H0 아래 관측 결과가 얼마나 이례적인지 평가한다. p값은 H0가 참일 때 관측값 이상으로 극단적인 결과의 확률이지 H0가 참일 확률이 아니다. p가 크면 H0를 채택하는 것이 아니라 현재 설계에서 기각할 충분한 증거가 없다고 말한다.

Stat & ML · 학습 노트

검정 선택과 해석

검정 선택은 이름보다 질문 구조에서 시작한다. 두 독립 평균에는 독립 t, 같은 사람 전후에는 대응 t, 세 집단 이상에는 ANOVA, 범주형 관련성에는 카이제곱을 고려한다. 정규성·등분산성·독립성은 결과 뒤에 붙이는 장식이 아니다.

Stat & ML · 학습 노트

회귀분석 기초

선형회귀는 입력 가중합으로 연속형 결과를 설명·예측한다. 다중회귀 계수는 다른 변수를 고정한다는 조건 아래의 변화다. 잔차 곡선·깔때기·영향점은 가정 문제를 시사하며 R²가 높아도 외삽·인과 설명은 보장되지 않는다.

Stat & ML · 학습 노트

모델링 실험 설계와 평가

모델 선택은 보지 않은 자료 일반화 성능을 추정하는 실험이다. 교차검증의 각 폴드 학습 부분에서만 대치·스케일링·변수 선택·리샘플링을 적합한다. 테스트셋은 선택이 끝난 뒤 한 번만 최종 보고에 사용하며, 불균형 자료에서는 정확도 대신 오류 비용에 맞는 지표를 본다.

Stat & ML · 학습 노트

지도학습: 선형 분류와 거리 기반 방법

지도학습은 입력과 레이블 쌍으로 새 입력을 예측한다. 로지스틱 회귀는 선형 점수를 확률처럼 변환하고, K-NN은 거리와 스케일에 민감하며, SVM은 여백이 큰 경계를 찾는다. 분류 임계값 0.5는 자연법칙이 아니라 오류 비용에 따른 의사결정 값이다.

Stat & ML · 학습 노트

트리와 앙상블

나무는 규칙을 반복 적용해 더 균질한 부분으로 나눈다. 깊은 나무는 학습 자료를 외워 일반화가 나빠질 수 있다. 배깅은 분산을 줄이고, 랜덤포레스트는 변수 무작위화도 쓰며, 부스팅은 앞 모델 오류에 순차 집중한다.

Stat & ML · 학습 노트

비지도학습과 차원 축소

비지도학습은 레이블 없이 구조를 탐색한다. 군집화는 관측치를 묶고 PCA는 변수를 적은 직교 축으로 요약한다. PCA 좌표는 군집 레이블이 아니다. K-평균은 거리 단위에 민감하고, PCA 첫 성분은 가장 큰 분산 방향일 뿐 가장 중요한 원인을 뜻하지 않는다.

Stat & ML · 학습 노트

신경망과 딥러닝 기초

신경망 층은 가중합·편향 뒤 비선형 활성화를 적용한다. 비선형성이 없으면 여러 층도 하나의 선형변환과 같다. 역전파는 손실의 가중치별 민감도를 계산하고 경사하강은 반대 방향으로 갱신한다. CNN은 공간 구조, RNN 계열은 순서 구조가 중요한 자료에 적합할 수 있다.

Stat & ML · 학습 노트

고급 데이터: 시계열·텍스트·시공간

시계열은 순서가 정보다. 추세는 장기 변화, 계절성은 주기 반복, 자기상관은 과거와 현재 관계다. 무작위 분할은 미래 정보를 학습으로 섞을 수 있다. 텍스트는 수치화하면서 문맥 손실이 생기고, 시공간 자료는 이웃 의존성 때문에 임의 행 분할을 경계한다.

Stat & ML · 학습 노트

모형 개선·결과 해석·시각화

너무 단순하면 신호를 놓치고 너무 유연하면 잡음까지 따라간다. 정규화는 큰 계수에 벌점을 주어 복잡도를 제어하며 초매개변수는 교차검증으로 선택한다. 테스트셋은 마지막 독립 평가에 한 번만 쓰고, 결과를 보고 재튜닝하면 새 테스트셋이 필요하다.

Stat & ML · 학습 노트

통합 분석 워크플로

좋은 분석은 알고리즘보다 질문에서 시작한다. 집단 차이 추론·미래 예측·구조 탐색 중 무엇인지 정하고 관측 단위·목표·오류 비용을 설계한다. 통계검정은 모집단 차이 증거를, 머신러닝 평가는 보지 않은 자료 예측을 다루므로 한 결과를 다른 목적의 증거로 바꾸지 않는다.

Stat & ML · 학습 노트

통계·머신러닝 용어집

이 용어집은 단어 번역뿐 아니라 정의, 인접 개념과의 경계, 해석상 주의점을 함께 제공한다. 장 본문의 첫 등장에서는 한국어와 영어를 병기하고, 여기서는 복습과 교차 참조에 사용한다.

Gen AI · 영상

도구 호출 경험을 망치지 않는 인터페이스

Product Notes 영상 강의

Project · Interactive

Median Lab

데이터 포인트를 옮기며 평균과 중앙값의 차이를 직접 확인하는 작은 실험.

Blog ·

데이터 글쓰기 루틴

분석 기록을 타인도 다시 읽을 수 있는 글로 바꾸는 편집의 순서.

Project · Prototype

Prompt Card Sort

프롬프트의 역할을 입력, 제약, 검토로 정렬해 보는 카드 도구.

Blog ·

조용한 인터페이스가 남기는 정보

많이 말하지 않는 화면이 더 오래 쓰이는 이유에 대하여.

Project · WEB PRODUCT

Knowledge Ops Dashboard

학습과 기록의 상태를 한 화면에서 읽는 개인 운영 도구.

Project · Note

SQL Timeline

윈도 함수의 프레임이 움직이는 방식을 한 줄씩 보여 주는 설명 노트.

Project · OPEN SOURCE

Topic Graph Viewer

문서의 관계를 그래프로 탐색하는 지식 시각화 실험.

Blog ·

작은 모델, 큰 작업 흐름

도구 선택보다 먼저 고정해야 하는 입력과 검토의 구조.

Project · Interactive

Distribution Shelf

분포의 모양을 고르고 대표값의 변화를 비교하는 미니 시뮬레이터.

Project · SERVICE CONCEPT

Metric Room

팀이 같은 숫자를 다른 장면에서 읽지 않도록 만드는 지표 공간.

Blog ·

거리에서 보는 대시보드

운영 화면에 필요한 것은 더 많은 지표가 아니라 읽는 순서다.

Blog ·

현장에서 수집한 작은 질문들

프로젝트를 진행하며 사라지기 전에 적어 둔 열두 개의 메모.

Project · PROTOTYPE

Writing Index

작업 중인 글과 참고 기록을 연결하는 개인 편집 도구.

Blog ·

배움을 공개하는 일의 밀도

완성본이 아닌 중간 기록을 다루는 태도.