전체 글 (49) 썸네일형 리스트형 실시간 데이터 처리 프로젝트 - 제작02 변경점Kafka로 암호화폐 거래 가격을 5초마다 긁어올 수 있음 -> consumer가 데이터를 수집하는 과정까지 구현 완료현재 로직Kafka producer 암호화폐 거래 가격 데이터 수집 -> Kafka consumer 데이터를 전달 받음진행 상황Kafka를 이용하여 데이터를 실시간으로 수집하고 관리하기 - 구현 중Airflow를 이용하여 데이터를 가공하고 모델을 학습하는 파이프라인 구성 - 구현 중웹 페이지 구현 - X기타 기능 - X오늘 한 일Kafka producer 구현Kafka consumer가 데이터를 전달받는 기능까지 구현yaml 파일 재구성암호화폐 심볼을 분석하여 가져올 가격 기준 설정프로젝트 내용 : https://github.com/sinjaeu/realtime_crypto GitH.. 실시간 데이터 처리 프로젝트 - 제작01 변경점airflow에서 5초마다 데이터를 가져오는 방식 -> kafka에서 데이터를 가져오고 airflow에서 가공 및 저장하는 방식으로 변경kafka 구성airflow 수정프로젝트 폴더 구조 변경yaml 파일 수정현재 로직외부 API -> Kafka -> airflow 진행 상황kafka로 데이터 가져오기 - 구현 중airflow와 연동 - 구현 중웹 페이지 구현 X모델 생성 X 프로젝트 내용 : https://github.com/sinjaeu/realtime_crypto GitHub - sinjaeu/realtime_cryptoContribute to sinjaeu/realtime_crypto development by creating an account on GitHub.github.com 저번 글.. 실시간 데이터 처리 프로젝트 - 개요 프로젝트 계획Binance API를 활용하여 암호화폐의 가격을 실시간으로 가져옴사용자가 원하는 암호화폐를 실시간으로 추적하고 가격을 시각화모델이 가져온 가격을 학습하여 미래 가격을 예측예측된 결과를 기반으로 사용자가 모의 투자모든 거래는 실제 거래가 아닌 모의 거래임 오늘 진행한 내용프로젝트 계획서 작성yaml 파일 구성dag 파일 생성코인의 가격을 실시간으로 가져오는 dag 파일 생성 프로젝트 내용 : https://github.com/sinjaeu/realtime_crypto GitHub - sinjaeu/realtime_cryptoContribute to sinjaeu/realtime_crypto development by creating an account on GitHub.github.com Apache Airflow Apache Airflow란?Apache Airflow는 데이터 공학 파이프라인을 위한 오픈 소스 워크플로 관리 플랫폼이다. 2014년 10월 에어비엔비에서 기업의 점차 복잡해지는 워크플로를 관리하기 위한 해결책으로서 시작하였다. Airflow는 파이썬으로 작성되어 있으며 워크플로는 파이썬 스크립트를 통해 만들어진다. Apache Airflow의 장점복잡한 워크플로 관리 및 시각화Airflow는 DAG(Directed Acyclic Graph)를 사용하여 워크플로를 시각적으로 표현하고 관리할 수 있습니다.DAG를 통해 작업 간의 종속성을 명확하게 정의하고, 복잡한 데이터 파이프라인을 쉽게 이해하고 관리할 수 있습니다.직관적인 UI를 통해 작업들의 상태를 모니터링하고, 로그를 확인할 수 있습니다.다양한 데.. Apache Kafka Apache Kafka란?Apache Kafka는 실시간 데이터를 처리하는 오픈소스 분산형 이벤트 스트리밍 플랫폼입니다. Kafka는 이벤트 기반 애플리케이션을 지원하고 신뢰할 수 있는 데이터 파이프라인을 구축하는 데 탁월하며, 지연 시간이 짧고 처리량이 높은 데이터 전송을 제공합니다. Apache Kafka의 장점Apache Kafka의 주요 장점은 대규모 데이터 스트리밍 처리, 고성능 및 확장성, 내구성과 신뢰성, 다중 컨슈머 기능 지원, 실시간 데이터 처리 등이 있습니다.대규모 데이터 스트리밍 처리 : KafKa는 대용량 실시간 데이터 스트리밍을 안정적이고 빠르게 처리하는 데 최적화된 분산 메시징 시스템입니다.고성능 및 확장성 : Kafka는 높은 처리량을 유지하면서 수평 확장이 가능하므로 대규모 .. Hadoop Hadoop이란?Apache Hadoop은 여러 컴퓨터 클러스터에서 대용량 데이터 세트를 분산 처리할 수 있는 프레임워크입니다. 단일 서버에서 수천 대의 머신까지 확장 가능하도록 설계되었으며, 각 머신은 로컬 연산 및 스토리지를 제공합니다. 고가용성을 제공하기 위해 하드웨어에 의존하는 대신, 라이브러리 자체가 애플리케이션 계층에서 장애를 감지하고 처리하도록 설계되어 장애 발생 가능성이 높은 여러 컴퓨터 클러스터를 기반으로 고가용성 서비스를 제공합니다. Hadoop 사용 이유Hadoop을 사용하는 이유는 크게 3가지 장점 때문입니다.1. 확장성 - 기존 시스템은 데이터 스토리지를 제한하지만, 하둡은 분산형 환경에서 작동하기 때문에 확장할 수 있습니다. 이 때문에 데이터 설계자가 하둡에서 일찍부터 데이터 .. 선형대수학 기초4 단위벡터단위벡터를 정의하기 이전에 $ \overrightarrow{v} $를 먼저 정의해봅시다. $ \overrightarrow{v} $ = $ \begin{bmatrix}2\\3\end{bmatrix} $로 정의를 했을 때 이는 수직으로 2만큼 수평으로 3만큼의 크기를 가진 벡터라고 할 수 있습니다. 이제 단위벡터를 정의해봅시다.단위벡터 i를 정의해봅시다. $ \widehat{i} $ = $ \begin{bmatrix}1\\0\end{bmatrix} $으로 정의할 수 있습니다. 수평방향으로 1만큼 이동하고 수직방향으로는 전혀 움직이지 않습니다.따라서 위 그림처럼 생겼습니다.단위벡터 j를 정의해볼까요? $\widehat{j} $ = $ \begin{bmatrix}0\\1\end{bmatrix} $로 정의.. 앙상블 기법 앙상블 기법 Ensemble Learning 이란 여러 개의 개별 모델을 조합하여 최적의 모델을 구성하는 방법입니다. 약한 모델을 여러개 결합하여 강력한 모델을 제작하는 방법으로 주로 모델에서 생기는 문제를 해결하기 위해 많이 사용합니다. 앙상블 기법에는 보팅(voting), 배깅(bagging), 부스팅(boosting), 스태킹(stacking)이 있습니다. 보팅(voting)보팅이란 한 데이터세트에 대해 서로 다른 알고리즘을 가진 분류기의 결합을 의미합니다.보팅에는 하드 보팅과 소프트 보팅으로 나뉘어 있습니다. 하드 보팅각 분류기가 최종 결과를 정하면 더 많이 지정한 결과를 최종 결과로 결정 소프트 보팅각 분류기마다 각 결과의 확률을 정하고 그 확률들의 평균값이 가장 큰 값을 최종 결과로 결정 배깅.. 이전 1 2 3 4 ··· 7 다음