전체 글

그냥 해
· AI 스터디
나이브 베이즈 분류기 (Naive Bayes Classifier, NBC)뭐하는 모델인가?새 데이터가 어느 클래스일지 확률로 판단하고, 가장 큰 확률의 클래스를 고르는 분류기아이디어 : 베이즈 규칙 + "클래스가 주어지면 각 특징은 서로 독립" 이라는 단순 가정 왜 Naive인가?실제론 특징들이 완전히 독립이 아니지만, 그렇게 가정하면 계산이 매우 쉬워지고 빨라짐특히 고차원, 희소 데이터(텍스트)에서 강력 학습, 예측 흐름사전확률 P(y) : 학습 데이터에서 각 클래스의 비중으로 계산조건부확률 P(특징|y) :범주형/단어 카운트 > 빈도 기반연속형 > 가우시안(평균,분산) 등으로 모델링스무딩(Laplace/Lidstone) : 한 번도 안 나온 값의 0 확률 문제를 방지 (분자, 분모에 작은 상수 더함)..
· AI 스터디
머신러닝은 주어진 데이터를 바탕으로 스스로 규칙성을 찾아내는 데 집중한다.발견한 규칙성을 이용해 새로운 데이터가 들어오면 그 규칙에 따라 정답을 예측하려 한다. 머신러닝의 장점많은 수동 조정과 규칙이 필요한 문제에 적합간단한 코드로 효과적인 수행되도록 할 수 있음전통적인 방식으로 해결 방법을 찾기 어려운 복잡한 문제에 적합유동적인 환경새로운 데이터에 빠르게 적응복잡한 문제, 대량의 데이터에서 통찰을 얻을 수 있음 머신러닝의 핵심 도전 과제충분하지 않은 데이터충분히 많은 양의 데이터로 학습해야 정확도가 높게 나옴대표성이 없는 데이터새로운 데이터에도 잘 적용되도록, 학습 데이터는 전체를 대표할 수 있어야 함샘플링 잡음 (sampling noise) : 샘플이 적을 때 우연에 의한 대표성 없는 데이터가 생김샘..
· AI 스터디
회귀식 검정결정계수 R²모형이 종속변수를 얼마나 잘 설명하는지를 나타내는 지표값이 1에 가까울수록 설명력이 높음단, 설명변수의 개수가 많아질수록 값이 커지는 경향이 있음 > 모델 비교 지표로는 한계 존재 수정된 결정계수 (Adjusted R²)설명변수 개수를 보정한 결정계수불필요한 설명변수를 추가했을 때 값이 감소할 수 있음서로 다른 모델(설명변수 개수가 다른)을 비교할 때 적합 회귀식 검정오차항에 대한 기본 가정회귀분석을 수행하기 위해서는 오차항이 다음 성질을 만족해야 함독립성 : 서로 독립등분산성 : 동일한 분산 가짐정규성 : 정규분포를 따름F-검정 (모형 전체 유의성 검정)회귀식 자체가 유의미한지를 검정귀무가설 H0: 축소모형 (RM, reduced model)이 적절대립가설 H1: 전체모형 (FM..
· AI 스터디
확률통계 기본 정리 & 개념중심극한정리조건확률변수들이 서로 독립일 것동일한 분포 (또는 일정한 평균과 분산을 가진 분포)에서 나올 것각 확률변수의 평균은 μ, 분산은 σ^2 의미모집단의 분포 형태가 어떻든 상관없이, 표본평균은 정규분포를 따른다.즉, 정규분포는 통계학에서 강력한 도구, 여러 통계적 추론의 기반이 된다.> 중심극한정리란, 표본이 충분히 크면 어떤 분포에서 왔든지 표본평균은 정규분포를 따른다는 강력한 통계 법칙> 표준화된 표본평균은 표준정규분포에 수렴한다는 뜻예시원래 데이터 분포가 한쪽으로 치우치거나 꼬리가 긴 분포라 하더라도,표본 크기를 크게 잡아 표본평균을 여러 번 구하면 그 분포는 점점 정규분포(종 모양)에 가까워짐주사위를 여러 번 굴려 평균을 계산 > 결과 분포는 정규분포에 수렴동전을..
· AI 스터디
확률 분포 종류T분포정의표본의 크기가 작을 때 모평균을 추정하거나, 모분산을 모를 때 사용하는 분포유도특징자유도 (df=n-1)에 따라 분포 모양이 달라짐표본수가 많을 수록 정규분포 N(0, 1)에 가까워짐꼬리가 정규분포보다 두꺼워서 극단값이 나올 가능성을 더 크게 반영사용 예시모평균 검정 (t-test)회귀분석 계수 검정 F분포정의두 개의 독립된 카이제곱 분포를 각각 자유도로 나누어 만든 비율 분포유도특징0 이상의 값만 가짐 (음수 x)분포의 모양은 자유도 df1, df2에 따라 달라짐사용 예시두 집단의 분산 비교 (분산분석, ANOVA)회귀 분석 모형의 전체 유의성 검정 카이제곱 분포정의표준정규분포 (평균 0, 분산 1)를 따르는 확률변수 Z를 제곱한 값이를 여러 개 더한 값이 따르는 분포를 카이제곱..
· AI 스터디
통계학모집단의 특성을 나타내는 모수(parameter)를 추정하기 위해 표본(sample)을 추출하고, 이를 통해 얻은 통계량(statistic)으로 모수를 추론하는 과정> 모집단의 모수를 추정하기 위해 표본을 추출하고, 표본에서 얻은 통계량으로 모수를 추론한다.용어모집단 : 연구대상이 되는 모든 가능한 관측값의 집합표본 : 모집단을 파악하기 위해 모집단에서 추출된 일부분모수(parameter) : 모집단의 특성을 나타내는 미지의 수 (ex) 대한민국 학생 평균 나이)통계량 : 표본의 특징을 나타내는 함수 (ex) 우리학교의 평균 나이) 경우의 수 계산하는 방법순열 : 서로 다른 n개에서 r개를 중복없이 뽑아 특정한 순서로 나열조합 : 서로 다른 n개에서 r개를 중복없이 순서를 고려하지 않고 뽑는 것 대..
· AI 스터디
확률특정한 사건이 일어날 가능성을 수로 표현한 것ex) 사건이 일어날 확률 P(x) = 사건 x가 일어나는 경우의 수 / 전체 경우의 수 = n(x) / n(S)> S란 전체 사건의 집합(표본 공간)cf) 표본 공간 : 발생가능한 모든 사건들의 집합, 전체 집합 확률변수사건으로 인해 그 값이 확률적으로 정해지는 함수표본 공간안에서 특정확률로 발생하는 사건을 특정한 수치에 대응시키는 함수, 이때 확률 변수가 취할 수 있는 모든 값 x의 집합을 상태공간이라고 한다. 확률함수 (P)확률 변수에 따라서 확률 값을 부여하는 함수 확률분포확률 변수가 갖는 모든 값과 그에 대응하는 확률을 나타내는 식> 표, 그래프, 확률 분포를 통해 통계적인 특성을 쉽게 이해할 수 있다.이산확률분포확률변수가 취할 수 있는 모든 값을..
· 자잘한 cs
JPA의 N+1문제는 연관관계가 설정된 엔티티를 조회할 경우, 조회된 데이터 개수(N)만큼 연관관계의 조회 쿼리가 추가로 발생하는 현상입니다.ex) 유저 한명이 쓴 게시글들을 조회할 때, 유저-게시글을 join한 형태의 쿼리문을 원했지만, N개의 게시글을 또 조회하는 쿼리가 날아가는 경우라고 생각하면 될 것 같습니다.  N+1 문제를 어떻게 해결할 수 있을까요?N+1문제를 해결하기 위해서는 fetch join 또는 @EntityGraph를 사용해 볼 수 있습니다.fetch join연관관계에 있는 엔티티를 한번에 즉시 로딩하는 구문입니다.쿼리 한번에 모든 데이터를 가져오기 때문에 JPA가 제공하는 Paging API 사용 불가능 (Pageable 사용 불가)1:N 관계가 두 개 이상인 경우 사용 불가fet..
망규
망규의 개발 기록