

7/15 ~4교시 학습
문제정의 (시각화를 어디까지 할까?) > 데이터정의 > 데이터수집 > 데이터 전처리 > 데이터 분석, 시각화 > 정보 도출
kaggle, kosis 자료 수집 사이트
prediction r2가 1에 가까울수록 정확하다.
그래프 반대로 되면 테이블 뒤집기 transform > transpose
if 데이터가 숫자처리 안되면 엑셀 가서 통화>숫자
새로운 함수를 다운해야한다면? > options > add ons
- data
file : 데이터가 쌓이고 쌓인 파일을 읽어온다.
data table : file으로 불러온 파일의 데이터 내용을 표 형식으로 볼 수 있게 한다.
type
분류 - categorical
산수 및 측정 - numerical
role
feature - 독립변수, 원인
target - 결과, 예측할 때 사용 ex)아이스크림 판매량
edit domain : 이름과 타입 변경
- transform
select columns : 행 삭제 select rows : 열 삭제
ignore new variables by default 체크하기
transpose : 행, 열 돌림
group by : 데이터를 그룹화
formula : 데이터 셋에 새로운 기능 추가 ex)학령인구수/총인구수 > 학령비율
- visualize
distributions (분포그래프) : 각 속성을 시각화
scatter plot(산점도) : 데이터 포인트를 산점도로 시각화하여 변수 간 관계를 탐색할 수 있다.
line plot (꺽은 선 그래프)
bar plot(막대그래프)
- model
knn (k-최근접 이웃) : 다양한 데이터 주에서 가장 갂운 데이터를 찾아 자신의 레이블을 결정
random forest
nural network (인공 신경망) : ex) 타이타닉 생존자 예측 모델
- evaluate
prediciton : 데이터에 대한 모델의 예측을 보여줌, R2가 1에 가까울수록 높은 정확도
- unsupervised
k-means : 군집화 알고리즘