데이터 출처·현황
어디서 · 무엇을 · 언제 가져와 가공했는지 투명하게 공개합니다
전국 실거래를 2006.01부터 매월 빠짐없이 모아, 새 거래가 들어오면 시세·지수·AI 예측까지 자동으로 다시 계산해요.
데이터 최신화 현황
무엇이 · 얼마나 자주 · 지금 어디까지 갱신됐는지
모든 수집은 매일 새벽 자동으로 돌고, 새 실거래가 들어온 날만 지수·AI 예측을 다시 계산해요. 예상 주기보다 밀리면 지연으로 표시되며, 다음 실행에서 밀린 기간까지 한 번에 따라잡습니다.
자주 묻는 질문
데이터 출처·갱신 주기·계산 방법을 눌러서 펼쳐보세요
· 표·스크리너의 「교통」은 새로 수집한 원천이 아니라 위 역세권·고속도로 IC·공항 점수에서 파생한 값입니다 — 평균이 아니라 역세권을 기준선으로 IC 35%·공항 15%를 더하는 가산 방식(평균을 내면 역이 드문 지방이 통째로 0점대로 눌려, 지방의 실제 이동수단인 고속도로를 가산으로 인정). 세 성분 모두 직선거리 기준이라 도로 실거리·소요시간과 다릅니다. 고속도로가 없는 제주·울릉 1,047단지는 IC 지표를 0점이 아니라 「해당없음」(빈 값)으로 두고, 통합 점수도 IC 가산 없이 역세권+공항만으로 냅니다(교통이 나쁘다는 뜻이 아니라 고속도로 접근이라는 축이 아예 없다는 사실). 이 세 지표는 좌표를 확보한 44,020단지(전체 45,421단지의 96.9%)에 붙고, 좌표가 없는 나머지는 값을 만들지 않고 비워둡니다.
· 고속도로 노선명은 원천 표기를 정규화했습니다 — 원천의 '경부선'은 철도 경부선과 이름이 겹쳐 캐스케이드에서 호선과 나란히 놓이므로 '경부고속도로'로 구분하고, '남해선(순천부산)' 같은 구간 표기는 구간을 떼어 '남해고속도로'로, '중부내륙선의 지선'은 '중부내륙고속도로 지선'으로 통일합니다. 노선이 겹치는 IC 61곳은 환승역처럼 여러 노선에 함께 속합니다.
· 고속도로 IC·공항과 통합 교통 점수는 AI 예측에 쓰지 않습니다 — 워크포워드 OOS 검증에서 단일 창만 보면 기여가 양수였지만 창을 4분기씩 밀어 재측정하니 부호가 뒤집혀, 우연으로 보고 기각했습니다. 거주점수 산식에도 넣지 않았습니다(표시·필터 전용). 같은 교통 축이라도 역세권은 검증을 통과해 AI 예측·거주점수에 들어갑니다 — 아래 「각 숫자는 어떻게 계산하나요」의 단지 고유기여 항목이 그 쓰임입니다.
· 모든 실거래는 국토교통부 공개 데이터를 그대로 수집했으며, 지수·점수는 공개 데이터로부터 자체 산출한 가공값입니다.
모든 수집은 실패 시 다음 실행에서 밀린 기간까지 한 번에 따라잡아요. 지금 어디까지 갱신됐는지는 위 데이터 최신화 현황에서 실시간으로 확인할 수 있어요.
모든 재계산은 하나의 자동 파이프라인에서 순서대로 일어나요(실거래→지수→AI→랭킹→반영). 실거래 수집이 멈추면 위 파생물 전부가 함께 멈춥니다.
백분위 점수가 아니라 앞으로 얼마에 거래될지를 예측해요. 지역과 단지를 나눠 투명하게.
금리·유동성·인구·공급·심리 반영
근거 얇으면 지역만 따름
6개월·1년·2년
IC = 예측 순위가 실제와 얼마나 맞았는지(0=무관, 1=완벽 · Spearman) · 모멘텀만 쓰면 —(역효과) 대비 크게 우위 · 예측이라 미래 보장은 아니에요.
- 리블: 코스피식 시총가중 체인연결. 단지 시총 = ₩/㎡ × (평균전용면적×세대수), 전국=Σ섹터=Σ단지. 직전월에도 있던 단지만 매칭해 가치가중 수익률을 연쇄(신규 유입 왜곡 제거, Case-Shiller 계열). 최근 12개월 무거래(휴면) 단지 제외. 전국·시도·구·동·신도시 전 계층.
- 한국부동산원: 기관 공식 전국주택가격동향조사 아파트 매매가격지수를 R-ONE Open API로 그대로 가져옴(가공 없음). 전국·시도·시군구. ※ 공동주택 실거래가격지수(반복매매)는 Open API 미제공이라 대표 지수인 매매가격지수를 사용.
② 기간 등락률 — 현재 ÷ (정확히 N개월 전 월중위 실거래가) − 1. 그 달 거래가 없으면 직전 실거래가로 캐리포워드하되, 공백이 기간보다 크면 억지로 만들지 않고 '산출 불가'(8년 전 거래를 '3개월 등락'이라 부르지 않음).
예상 상승률 = 지역기대 + 단지 고유기여로 분해해 냅니다. ① 지역기대(μ) = 지역 지수 시계열을 GBM(그래디언트 부스팅 머신러닝)으로 예측한 절대수익(모멘텀+거시: 기준·시장금리(국고채)·M2 유동성·소비심리·인구 순이동·미분양·분양물량·청약경쟁률·외지인·전세가율, VIF로 다중공선성 제거). 장기일수록 무조건부 장기드리프트로 수축(shrinkage)해 현재 국면 과의존을 막습니다. ② 단지 고유기여 = 같은 단지가 지역 대비 얼마나 더/덜 오르는지(GBM 단면 초과수익 — 모멘텀·거래활동에 학군·역세권·공원·용적률·건폐율·대지지분·주차 등 입지·구조 요인까지 워크포워드 OOS로 검증해 반영), 구(區) 중위로 재중심화해 지역성분 이중계상을 제거. ③ 근거가중 w — 그 단지의 실거래 개월수·건수가 얇으면(신축·희소거래) w→0으로 눌러 지역전망을 그대로 추종(무근거 극단값 방지). 예상가 = 현재가 × (1+예상상승률), 지평별 상한·누적 단조성 적용. 피처는 전부 그 시점까지 데이터만(미래참조 없음).
검증(정직): 2006~2026 분기를 과거로만 학습→그 분기 예측하는 워크포워드 OOS(미래를 미리 보지 않는 검증). 여기에 라벨(H개월 선행수익)이 학습·검증 구간에서 겹치지 않도록 H개월 embargo(purge)까지 적용해 중첩라벨 누수를 제거했어요 — 실시간 예측 제약을 그대로 재현한 정직한 수치예요. 단지 단면 순위IC(0=무관·1=완벽) — 1년 ≈ —(분기 대부분 양수, 모멘텀 baseline ≈ — 대비 확실한 우위 — 부동산 단면예측으론 견실). 다만 2년 이상 장기는 이 정직 검증에서 예측 신호가 거의 사라져(IC 0 부근), 방향 예측 대신 지역 장기드리프트를 그대로 추종하게 눌렀습니다. 그래서 검증된 예측은 1년이고, 예측이라 미래를 보장하진 않으니 참고용.
아직 실거래가 없는 분양·예정 단지도 분양가와 주변 실거래 단지(좌표 최근접) 시세·흐름·지역 전망을 종합해 콜드스타트로 1년 중심 참고 추정을 제공해요. 주변 시세 기반의 대략적 추정이라, 입주·거래가 시작되면 실거래 기반 정식 예측으로 전환돼요.
④ 공포·탐욕 지수 — 시세 4축(가격모멘텀·거래량·시장폭·변동성)에 공급(미분양)·수요(전세가율)·신용심리(회사채 신용스프레드·주택가격전망)까지 8개 신호를 그 시점까지의 확장창 백분위(미래참조 없음)로 환산해 가중평균×100 (0=극단공포 ~ 100=극단탐욕). 부호는 동시점 심리 기준(신용경색·고변동성=공포)이라 2008 금융위기·2022 폭락이 극단공포, 2015·2021 과열이 탐욕으로 제대로 찍혀요.
⑤ 상대가치 스프레드 — 신축÷구축·대형÷소형·강남3구÷노도강의 월중위 ₩/㎡ 비율을 36개월 롤링 z-score로 신호화(±2 = 역사적 과열/압축).
⑥ 거래량·거래대금(유동성) — 지역별 월 실거래 건수·거래대금(=거래가 합, 억). 확정월 거래건수를 직전 12개월 평균과 비교해 활력(%)을 표시.
⑦ 전세가율·전월세 전환율 — 한국부동산원 공식(전세평균÷매매평균, 전환율 %). 지역별 현재값·1년 변화.
⑧ 신고지연 확정월 — 실거래는 계약 후 최대 30~60일 내 신고돼 최근 1~2개월은 미완성. 위 집계 지표(①·④·⑤·⑥)는 신고가 대부분 확정된 — 기준으로 계산하고 최근 잠정월은 제외합니다. 개별 단지 실거래·시세는 최신 거래를 그대로 표기.
⑨ 섹터 지수·가격수준·변동성 — 규모/연령별 매매지수·평균/중위 ₩/㎡는 한국부동산원 공식(R-ONE). 지역 변동성(부동산 VIX)은 단지 변동성의 시총가중 지역 평균(자체).
⑩ 단지 개요 보강 — K-apt(의무관리)에 없는 단지는 한국부동산원 단지식별 API로 세대수·동수·준공을, 건축물대장으로 주차·연면적을 보강합니다. 매칭은 법정동코드+본번(PNU)+단지명 정규화로만 하고, 억지 매칭은 하지 않습니다.
⑪ 브랜드·시공사 교차검증 — 단지명에서 브랜드 로고를 매칭하되, 짧은 약칭(DH·THE H·써밋 등)은 실제 시공사가 그 브랜드 건설사와 일치할 때만 로고를 붙여 오탐을 제거합니다. 예: '검단신도시한신더휴(THE HUE)'는 THE H로 오인되지 않고 한신더휴로, 소규모 'DH씨밀레'는 현대건설 디에이치 로고가 붙지 않습니다.
· 지수·점수는 공개 실거래 데이터로부터 자체 산출한 가공값이며, 없는 값은 만들지 않고 '산출 불가'로 둡니다.
전국 —개 단지, 실거래 데이터가 있는 시·군·구 —(—), 누적 실거래 —건. 개요(세대수·시공사)까지 확보한 단지는 —개예요.
· 모든 실거래는 국토교통부 공개 데이터를 그대로 수집했으며, 지수·점수는 공개 데이터로부터 자체 산출한 가공값입니다.
· 신고 지연으로 최신월 데이터는 이후 갱신될 수 있습니다. 상단 기준월 배지가 그 시점을 나타냅니다.