'dataframe' 태그의 글 목록

PREV 이전 1 NEXT 다음

dataframe

데이터 분석기법] 카이제곱검정, anova(f_oneway), ttest_p-value, barbplot 2023.11.30
데이터 전처리 그룹] 2023.09.08

데이터 분석기법] 카이제곱검정, anova(f_oneway), ttest_p-value, barbplot

하나둘셋넷_1234 2023. 11. 30. 23:29

2023. 11. 30. 23:29

728x90

범주형 feature -> 수치형 target

카이제곱 검정, ttest, ANOVA 검정에서의 p_value의 의미

ㆍ t-검정

- 귀무가설 : 집단의 평균 간에 차이가 없을 것이다.

- p-value < 0.05 : 귀무 가설 기각, 집단 간의 평균에 유의미한 차이가 있다.

ㆍ 카이제곱 검정

- 귀무가설 : 두 집단의 빈도 분포가 독립적이다.

- p-value < 0.05 : 귀무 가설 기각, 두 집단의 빈도 분포가 독립적이지 않을 것이다.

ㆍ ANOVA

- 귀무가설 : 집단(세 개 이상)의 평균 간에 차이가 없을 것이다.

- p-value < 0.05 : 귀무 가설 기각, 집단 간의 평균에 유의미한 차이가 있다.

(1) Gender

plt.figure(figsize = (15,8))
sns.barplot(x='Gender', y='Score_diff_total', data = base_data)
plt.grid()
plt.show()

## 범주 데이터 확인 : value_counts()
base_data['Gender'].value_counts()

## 평균 분석 : ttest_ind

t_male = base_data.loc[base_data['Gender']=='M', 'Score_diff_total']
t_female = base_data.loc[base_data['Gender']=='F', 'Score_diff_total']

spst.ttest_ind(t_male, t_female)

3-2-2) 학습목표

# 그래프 분석 : barplot

plt.figure(figsize = (15,8))
sns.barplot(x='학습목표', y='Score_diff_total', data = base_data)
plt.grid()
plt.show()

## 범주 데이터 확인 : value_counts()
base_data['학습목표'].value_counts()

## 분산 분석 : f_oneway

anova_1 = base_data.loc[base_data['학습목표']=='승진', 'Score_diff_total']
anova_2 = base_data.loc[base_data['학습목표']=='자기계발', 'Score_diff_total']
anova_3 = base_data.loc[base_data['학습목표']=='취업', 'Score_diff_total']

spst.f_oneway(anova_1, anova_2, anova_3)

3-2-3) 학습방법

## 그래프 분석 : barplot

plt.figure(figsize = (15,8))
sns.barplot(x='학습방법', y='Score_diff_total', data = base_data)
plt.grid()
plt.show()

## 범주 데이터 확인 : value_counts()
base_data['학습방법'].value_counts()

## 분산 분석 : f_oneway

anova_1 = base_data.loc[base_data['학습방법']=='온라인강의', 'Score_diff_total']
anova_2 = base_data.loc[base_data['학습방법']=='오프라인강의', 'Score_diff_total']
anova_3 = base_data.loc[base_data['학습방법']=='참고서', 'Score_diff_total']

spst.f_oneway(anova_1, anova_2, anova_3)

3-2-4) 강의 학습 교재 유형

## 그래프 분석 : barplot

plt.figure(figsize = (15,8))
sns.barplot(x='강의 학습 교재 유형', y='Score_diff_total', data = base_data)
plt.grid()
plt.show()

## 범주 데이터 확인 : value_counts()
base_data['강의 학습 교재 유형'].value_counts()

## 분산 분석 : f_oneway

anova_1 = base_data.loc[base_data['강의 학습 교재 유형']=='일반적인 영어 텍스트 기반 교재', 'Score_diff_total']
anova_2 = base_data.loc[base_data['강의 학습 교재 유형']=='영상 교재', 'Score_diff_total']
anova_3 = base_data.loc[base_data['강의 학습 교재 유형']=='뉴스/이슈 기반 교재', 'Score_diff_total']
anova_4 = base_data.loc[base_data['강의 학습 교재 유형']=='비즈니스 시뮬레이션(Role Play)', 'Score_diff_total']

spst.f_oneway(anova_1, anova_2, anova_3, anova_4)

3-2-6) 취약분야 인지 여부

## 그래프 분석 : barplot

plt.figure(figsize = (15,8))
sns.barplot(x='취약분야 인지 여부', y='Score_diff_total', data = base_data)
plt.grid()
plt.show()

## 범주 데이터 확인 : value_counts()

base_data['취약분야 인지 여부'].value_counts()

## 평균 분석 : ttest_ind

t_yes = base_data.loc[base_data['취약분야 인지 여부']=='알고 있음', 'Score_diff_total']
t_no = base_data.loc[base_data['취약분야 인지 여부']=='알고 있지 않음', 'Score_diff_total']

spst.ttest_ind(t_yes, t_no)

728x90

'데이터 - 분석기법' 카테고리의 다른 글

데이터 분석기법] 상관관계 분석_피어슨 상관계수, regplot, heatmap (0)	2023.11.30

하나둘셋넷 하나둘셋넷_1234 님의 블로그입니다.

데이터 전처리 그룹]

하나둘셋넷_1234 2023. 9. 8. 01:36

2023. 9. 8. 01:36

728x90

데이터 전처리 그룹]

그룹 - groupby

groupby( by = ['컬럼1', '컬럼2'], as_index = False )[['컬럼 3']].sum()

groupby( by = ['컬럼1'],as_index = False)[['컬럼2', '컬럼3']].sum()

728x90

'데이터 - 전처리' 카테고리의 다른 글

데이터 전처리 날짜, date, Date] (0)	2024.01.05
데이터 전처리 파일 다루기] (0)	2024.01.05
데이터 전처리] 1,234 등 숫자에서 쉼표를 제거하고 숫자형으로 형식 변경, 빈 칸 np.nan으로 대체 및 제거, str.replace(',', '').astype(float), np.nan, subset (0)	2023.12.16
데이터 전처리 가변수화] one-hot encoding, pd.get_dummies (0)	2023.12.02
데이터 전처리] 데이터 파싱, xml.etree.ElementTree, bs4, Beautiful Soup Parsing, pprint (0)	2023.11.18

하나둘셋넷 하나둘셋넷_1234 님의 블로그입니다.

내 블로그 - 관리자 홈 전환	`Q` `Q`
새 글 쓰기	`W` `W`

글 수정 (권한 있는 경우)	`E` `E`
댓글 영역으로 이동	`C` `C`

이 페이지의 URL 복사	`S` `S`
맨 위로 이동	`T` `T`
티스토리 홈 이동	`H` `H`
단축키 안내	`Shift` + `/` `⇧` + `/`

하나둘셋넷

dataframe

데이터 분석기법] 카이제곱검정, anova(f_oneway), ttest_p-value, barbplot

범주형 feature -> 수치형 target

카이제곱 검정, ttest, ANOVA 검정에서의 p_value의 의미

'데이터 - 분석기법' 카테고리의 다른 글

데이터 전처리 그룹]

데이터 전처리 그룹]

그룹 - groupby

'데이터 - 전처리' 카테고리의 다른 글

+ Recent posts

티스토리툴바

개인정보

단축키

내 블로그

블로그 게시글

모든 영역