카테고리 없음

교육 자율주간 오렌지 학습

2024 자탐 2025. 7. 15. 12:26

 

 

 

 

7/15 ~4교시 학습

문제정의 (시각화를 어디까지 할까?) > 데이터정의 > 데이터수집 >  데이터 전처리 > 데이터 분석, 시각화 > 정보 도출

kaggle, kosis 자료 수집 사이트

prediction r2가 1에 가까울수록 정확하다. 

그래프 반대로 되면 테이블 뒤집기 transform > transpose

if  데이터가 숫자처리 안되면 엑셀 가서 통화>숫자

새로운 함수를 다운해야한다면? > options > add ons

  • data 

file : 데이터가 쌓이고 쌓인 파일을 읽어온다.

data table : file으로  불러온 파일의 데이터 내용을  표 형식으로 볼 수 있게 한다.

            type

                 분류 - categorical

                 산수 및 측정 - numerical 

            role

                 feature - 독립변수, 원인

                 target - 결과, 예측할 때 사용 ex)아이스크림 판매량

edit domain : 이름과 타입 변경

 

  • transform

select columns : 행 삭제     select rows : 열 삭제

      ignore new variables by default 체크하기

transpose : 행, 열 돌림

group by : 데이터를 그룹화

formula : 데이터 셋에 새로운 기능 추가 ex)학령인구수/총인구수 > 학령비율

 

  • visualize

distributions (분포그래프) :  각 속성을 시각화

scatter plot(산점도) : 데이터 포인트를 산점도로 시각화하여 변수 간 관계를 탐색할 수 있다. 

line plot (꺽은 선 그래프)

bar plot(막대그래프)

 

  • model

knn (k-최근접 이웃) : 다양한 데이터 주에서 가장 갂운 데이터를 찾아 자신의 레이블을 결정

random forest

nural network (인공 신경망) : ex) 타이타닉 생존자 예측 모델

 

  • evaluate

prediciton : 데이터에 대한 모델의 예측을 보여줌, R2가 1에 가까울수록 높은 정확도

 

  • unsupervised

k-means : 군집화 알고리즘