본문 바로가기

ML9

콘텐츠 기반 필터링 (Contents-Based Filtering) 캡스톤 디자인 2 프로젝트를 진행하면서 가격을 추천하기 위해 사용할 알고리즘을 찾던 중, 콘텐츠 기반 필터링을 발견하여 구현하게 되었다. 본 글은 해당 알고리즘의 개념에 대해 기록한 글이다. 콘텐츠 기반 필터링 (Contents-Based Filtering) 1) 기본 개념 - 콘텐츠끼리의 유사도를 분석하여 사용자에게 추천하는 알고리즘 - 장르 및 키워드 등 콘텐츠의 정보를 벡터화하여 유사도를 측정 → 우리 프로젝트는 거래가 완료된 제품들 중에서 판매하려는 상품과 유사한 제품을 찾아 판매자에게 가격을 추천한다. → 즉, 제품의 정보가 담긴 'subtitle'을 벡터화하여 유사도를 측정한다. 2) 사용 개념 ① TF-IDF(Term Frequency-Inverse Document Frequency) - D.. 2023. 4. 11.
[ML] Ch14. Reinforcement Learning 1. Reinforcement Learning의 특징 ; data + reward (1) no supervisor (label x), 오직 reward signal만 있음 (2) 피드백이 지연됨, 동시에 발생하지 않음 (3) 시간이 정말 중요 (sequential, non i.i.d. data) (4) Agent의 액션은 agent가 수신하는 다음 데이터에 영향을 줌 (현재 선택이 다음에 영향을 줌) 2. Rewards (1) reward Rt는 스칼라 피드백 시그널 (2) t 단계에서 agent가 얼마나 잘 움직이는지 나타냄 (3) agent의 일은 누적된 reward를 최대화 (4) Reinforcement Learning은 reward hypothesis을 기반으로 함 - reward hypothe.. 2022. 6. 19.
[ML] Ch13. Dimensionality Reduction **Dimensionality Reduction - 연산량 감소, 성능 향상, 시각화 가능 ** PCA (Principal Component Analysis) - label x -> unsupervised ** LDA (Linear Discrement Analysis) - label o -> supervised 1. 문제점 (1) 많은 object detection window가 있을 경우 ->computationally intensive (2) 각 window는 높은 dimensional data 높은 dimensional raw data (image, video, audio, text) -> Feature extraction, Dimensionality reduction -> Classifier, d.. 2022. 6. 19.
[ML] Ch12. Clustering 1. Clustering (1) 개념 - Unsupervised Learning : data lebel 제공x - 데이터가 필요하지만, label은 필요하지 않음 - 패턴 감지 - 무엇을 찾고 있는지 모를 때 유용 (2) Basic idea : 비슷한 인스턴스들을 그룹핑 - similarity는 distance와 반비례 - similarity : option - 작은 Euclidean distance - Clustering 결과는 클러스터링할 포인트들 사이의 similarity나 distance 측정에 의존 (3) 알고리즘 - Partition algorithms : K-means : Mixture of Gaussian : Spectral clustering - Hierarchical algorithms.. 2022. 6. 19.
[ML] Ch11. Ensemble Learning 1. 개념 (1) 모델들의 set을 사용하는 프로세스로, 각 모델들은 주어진 문제에 대해 학습 프로세스를 적용하여 얻을 수 있음 (2) 이 모델들의 set (Ensemble)은 최종 예측을 얻기 위해 합쳐짐 (3) 정확도의 향상을 목표로 여러 개의 학습된 모델들을 합침 2. Types of ensembles (1) Ensemble methods - Classification : 분류 결과를 종합하여 최종 결과를 얻음 - Regression : 연속적인 값으로 여러 모델을 얻고, 이 모델들의 평균값을 regression - Clustering (consensus clustering) : 여러 버전의 clustering 결과를 averaging하여 최종 결과를 얻음 (2) Ensembles의 분류 - Hom.. 2022. 6. 18.
[ML] Ch10. Deep Neural Networks 2 1. Data Processing (1) 뉴런의 input이 항상 양수이거나 정수일 경우 w의 gradient 는 항상 양수이거나 음수가 됨 -> zero-mean data 필요 gradient가 지그재그이면 w 업데이트가 느리게 진행되고, 학습도 느리게 진행됨 따라서 training time, accuracy에 문제 생김 -> 해결책 Preprocess the data original data를 PCA를 이용하여 decorrelated data로 변경 (차원을 축소) : data rotation, data는 diagonal covariance matrix를 갖게됨 위의 그림에선 2차원 오리지널 데이터를 1차원으로 축소 **PCA : data dimensionality reduction decorrela.. 2022. 6. 18.