초보자의 빅데이터 정복기
SQL 연습 기본문 select 문 ❖select 문에서 * 을 사용 하면 테이블의 모든열 데이터 모두 조회 가능 ❖ 특정 Column 선택 ❖ 테이블의 특정 Column을 검색하고자 할 경우 Column이름을 “,”로 구분하여 명시함으로써 특정 Column을 출력할 수 있다. ❖ 출력 순서는 SELECT문 뒤에 기술한 Column의 순서대로 출력 ❖ 산술 표현식 ❖ 데이터가 출력 되는 방식을 수정하거나 계산을 수행하고자 할 때 사용 ❖ 산술 표현식은 열 이름, 숫자 상수, 문자 상수, 산술 연산자를 포함할 수 있으며 연산자는 +(Add), -(Subtract), *(Multiply), /(Divide) 사용 ❖ SELECT문장에서는 FROM절을 제외한 SQL문장의 절에서 사용할 수 있다. ❖ 하나 이상..
# chap13_1_Eigenvalue ########################### ## 고유값과 고유벡터 ########################### ## 고유값(Engenvalue) : 독일어 # - 정방행렬A(n,n)를 요약하는 값 또는 특이값 # - 행렬에서 차원(변수)의 특징 # - 스칼라 값으로 λ(람다) 표현하며, 수치의 크기는 특징의 강도 ## 고유벡터 # - 고유값에 해당하는 0(영)이 아닌 벡터 ## 응용분야 # - PCA(주성분분석)/FA(요인분석), SVD(특이값분해), 선형연립방정식 등 # 행렬A(n,n) A = matrix(c(3, 0, 8, -1), nrow = 2, byrow = T) A dim(A) # 벡터 v v = 1:2 # 행렬연산을 위해서 모양변경 v 유사..
# chap12_CorrelationAnalysis ###################################### # 1. 피어슨(Pearson) 상관계수 ###################################### # - 두 변수 x,y의 상관성(관련성) 분석 # - 사용 변수 : 숫자형 변수(등간/비율) # - 관련함수 : cor(), cov(), cov2cor() product 다소 높은 양의 상관관계 cor(product$제품_친밀도, product$제품_만족도, method="pearson") # 0.467145 -> 다소 높은 양의 상관관계 # 전체 변수 간 상관계수 보기 : 상관계수 행렬 cor(product, method="pearson") # 피어슨 상관계수 - defau..
chap19_AssociationAnalysis ################################################### # 연관분석(Association Analysis) ################################################### # 특징 # - 데이터베이스에서 사건의 연관규칙을 찾는 무방향성 데이터마이닝 기법 # - 무방향성(x -> y변수 없음) -> 비지도 학습에 의한 패턴 분석 방법 # - 사건과 사건 간 연관성(관계)를 찾는 방법(예:기저귀와 맥주) # - A와 B 제품 동시 구매 패턴(지지도) # - A 제품 구매 시 B 제품 구매 패턴(신뢰도) # 예) 장바구니 분석 : 장바구니 정보를 트랜잭션(상품 거래 정보)이라고 하며, # 트랜잭션..
chap18_ClusteringAnalysis ################################################### # 군집분석(Clustering) ################################################### # 유사성 거리에 의한 유사객체를 묶어준다. # 거리를 측정하여 집단의 이질성과 동질성을 평가하고, 이를 통해서 # 군집을 형성한다.. # 유사성 거리 : 유클리드 거리 # y변수가 없는 데이터 마이닝 기법 # 예) 그룹화를 통한 예측(그룹 특성 차이 분석-고객집단 이해) # 주요 알고리즘 : hierarchical, k-means # 1. 유클리드 거리 # 유클리드 거리(Euclidean distance)는 두 점 사이의 거리를 계산하는 #..
# chap17_RandomForest ################################################## #randomForest ################################################## # 결정트리(Decision tree)에서 파생된 모델 # 랜덤포레스트는 앙상블 학습기법을 사용한 모델 # 앙상블 학습 : 새로운 데이터에 대해서 여러 개의 Tree로 학습한 다음, # 학습 결과들을 종합해서 예측하는 모델(PPT 참고) # DT보다 성능 향상, 과적합 문제를 해결 install.packages('randomForest') library(randomForest) # randomForest()함수 제공 data(iris) # 1. 랜덤 포레스트 모..