Search
Duplicate
moon
sun
🖼️

12. URL 기반 AI 웹 크롤링 에이전트

💡
•
웹사이트 주소와 필요한 데이터 항목을 입력하면 AI가 사이트 구조를 분석함
•
분석한 구조에 맞춰 수집 코드를 작성하고 데이터를 정리함
[장점]수집 결과를 엑셀·PDF·마크다운·HTML 대시보드로 만들 수 있음
목차

0.관련 링크 및 깃허브, 설치

0-1. 웹 크롤링의 개념과 필요성

[참고자료]
•
GitHub 저장소: web-crawler (오픈소스, 자유 사용·수정·재배포 가능)
web-crawler
byungjunjang
•
해당 깃허브 주소를 클로드 코드나 코덱스, 안티 그래비티 등에 입력 후 해당 깃허브를 현재 폴더에 클론하고, 사용할 수 있게 셋팅해달라고 요청하기
◦
핵심 키워드: 클론, 셋팅, 사용준비 테스트
https://github.com/byungjunjang/web-crawler 내가 해당 페이지의 Agent를 사용할 수 있도록 -현재 작업폴더에 클론 -사용할 수 있도록 셋팅 -사용준비 테스트를 통해 오류 수정
Markdown
복사

0-2. 설치과정에서 알게된 점

•
크롬의 3가지 역할
•
CDP는 Chrome DevTools Protocol의 약자
◦
사람이 Chrome을 직접 실행해 두고 Agent가 크롬 개발자 도구용 조종석에 연결하는 방식
•
CDP를 사용하는 이유? - CDP의 중요한 장점은 단순히 User-Agent만 Chrome이라고 속이는 것이 아니라, Chrome 자체의 TLS 통신 방식과 브라우저 실행 환경을 사용하기 때문에 보다 우회에 특화되어 있음
•
chrome과 chromium의 차이?
◦
Chromium은 자동차의 기본 설계와 엔진
◦
Chrome은 Google이 그 설계로 완성해 판매하는 자동차
구분
Chromium
Google Chrome
성격
오픈소스 브라우저 프로젝트
Google의 완성형 상용 브라우저
개발 주체
Chromium 오픈소스 커뮤니티와 Google
Google
로고·브랜드
Chromium
Google Chrome
업데이트
배포판이나 사용자가 관리
Google 자동 업데이트 포함
Google 서비스
기본적으로 제한적
계정 동기화 등 Google 기능 통합
자동화 사용
Playwright가 관리하기 편함
실제 사용자 환경 재현에 유리

0-3. 원본 영상

알아서 웹 데이터 긁어오는 AI 에이전트 무료로 나눠드려요. 쿠팡·인스타·네이버 카페까지 긁어옵니다 | Claude Code / Codex 에이전트 활용
입찰 공고, 채용 공고, 리뷰 데이터. 필요할 때마다 한 건씩 복사·붙여넣기 하고 계신가요? 이런 분들으 위해 웹 크롤링 에이전트 'web-crawler'를 무료로 공개합니다. 📦 web-crawler 무료 설치 : https://github.com/byungjunjang/web-crawler (⭐ 도움이 되셨다면 Github에서 Star도 눌러주세요) 이 에이전트를 Claude Code나 ChatGPT Work에서 셋팅하고, URL을 붙여넣고 무엇을 모을지 한 줄로 설명하면 끝입니다. 에이전트가 알아서 사이트를 정찰하고, 사이트에 맞는 수집 코드를 짜고, 엑셀로 정리해 줍니다. 나라장터 입찰 공고 140건, 금감원 보도자료와 첨부 PDF 107개, 쿠팡 리뷰 1,000건. 로그인해야 보이는 네이버 카페와 인스타그램까지 실제로 수집해 봤습니다. 영상 후반부에는 이 에이전트를 각자 업무에 맞게 '개량'하는 세 가지 방법과, 크롤링의 법적 기준 여섯 가지, 그리고 AI와 함께 일 잘하는 방법에 대한 생각도 함께 담았습니다. 📌 이런 분께 추천합니다 · 입찰 공고, 채용 공고, 매물 정보, 규제 동향을 주기적으로 모아야 하는 직장인 · 리뷰·VOC 데이터를 모아 분석하고 싶은 마케터, 상품기획자 · 노코드 크롤링 툴(옥토파스 등) 학습에 시간을 썼거나, 쓰다 포기하신 분 · 코딩은 모르지만 챗GPT·클로드를 구독 중인 비개발자 · AI 도구를 '쓰는' 단계에서 '내 업무에 맞게 고쳐 쓰는' 단계로 넘어가고 싶은 분 📌 영상에서 다루는 내용 · GitHub 저장소를 내 컴퓨터에 세팅하는 법 (비개발자 기준으로 설명) · URL + 한 줄 설명만으로 엑셀이 만들어지는 과정 · 다양한 사이트에서 웹사이트 데이터를 크롤링하는 과정 · 목록형이 아닌 사이트, 상세페이지 진입 수집, 첨부 PDF 다운로드하는 과정 · 로그인이 필요한 사이트, 봇 차단이 강한 사이트 등 기존 크롤링 대안으로 수집이 어려웠던 사이트의 데이터를 크롤링하는 과정 · 순정 클로드 코드와 웹 크롤링 에이전트의 결과 비교 · 코드와 LLM이 역할을 나누는 에이전트 설계 원리 · 루틴·예약으로 매일 자동 수집하고 슬랙·메일로 결과 받기 · 웹 크롤링 적법성 판단의 여섯 가지 기준 00:00 인트로 01:05 웹 크롤링 에이전트 무료 공개, 설치까지 03:47 실전 ① 공공 기관 — 나라장터 입찰공고 05:25 실전 ② 공공 기관 — 첨부파일 다운로드 및 목록형이 아닌 사이트 수집 07:29 실전 ③ 채용 공고 — 원티드 (세부 페이지까지) 08:33 실전 ④ 뉴스 모니터링 — 네이버 뉴스 09:58 실전 ⑤ 부동산 매물 — 네이버 부동산 11:37 동작 원리 — 정찰하고, 전략 짜고, 코드를 씁니다 13:34 실전 ⑥ 리뷰 — 쿠팡 (봇 차단 문제 해결) 16:37 실전 ⑦ 로그인이 필요한 네이버 카페·인스타그램 19:02 에이전트의 진짜 위력은 '개량'에서 나옵니다 21:46 크롤링, 법적으로 어디까지 되나 — 여섯 가지 기준 23:44 마치며 — AI와 함께 일 잘하는 방법 ━ 이 에이전트를 직접 돌려보시고 어떠셨는지 댓글로 남겨주세요. 루틴 기능을 더 깊게 다뤄달라는 요청이 많으면 그 주제로도 영상을 준비하겠습니다. 다음 영상에서도 실무에 바로 쓸 수 있는 에이전트를 하나 만들어서 들고 오겠습니다. #웹크롤링 #크롤링 #챗GPT #클로드 #claudecode #AI에이전트 #업무자동화 #데이터수집 #직장인AI #오픈소스

URL 하나로 시작하는 AI 웹 크롤링 에이전트

Ⅰ. 웹 크롤링 에이전트 이해와 시작

1-1. 웹 크롤링의 개념과 필요성

•
웹 크롤링의 정의
◦
인터넷에 공개된 정보를 자동으로 찾아 수집하는 작업임
◦
수집한 정보를 검색·비교·분석하기 좋은 형태로 정리함
•
기존 크롤링 방식의 특징
◦
웹사이트 구조를 직접 분석해야 했음
◦
사이트에 맞는 수집 코드를 작성해야 했음
•
AI 에이전트를 이용할 때의 변화
◦
사용자가 수집 목적과 항목을 자연어로 설명함
◦
AI가 웹사이트의 목록·검색·상세 페이지 구조를 분석함
◦
AI가 사이트에 맞는 수집 전략과 코드를 작성함
◦
수집한 데이터를 다시 AI에 제공해 요약·분류·비교·시각화를 진행함

1-2. 에이전트의 기본 사용법과 사용Tip

•
사용자가 준비할 정보
◦
수집할 웹페이지의 URL
◦
수집할 기간과 범위
◦
검색어와 필터 조건
◦
필요한 데이터 항목
◦
결과 파일의 형식
•
수집 대상을 구체적으로 지정하기
◦
홈페이지 주소보다 실제 목록이나 검색 결과의 URL 전달하기
◦
수집할 게시판·상품·지역·직무 범위를 명시하기
•
수집 조건을 구체적으로 지정하기
◦
시작일과 종료일 지정하기
◦
키워드와 제외 조건 지정하기
◦
최대 수집 건수 지정하기
[사용Tip]
✅이 Agent는 단순히 텍스트만 긁어오는 것이 아니라 첨부파일도 대량 저장 가능
•
결과 형식을 지정하기
◦
엑셀·CSV·마크다운·PDF 중 필요한 형식 선택하기
◦
첨부파일을 저장할 폴더 지정하기
◦
파일명과 열 순서 지정하기

Ⅱ. 업무별 데이터 수집과 분석 사례

2-1. 교육부 보도자료와 첨부파일 수집

크롤링 타겟 페이지
[예시 프롬프트]
[https://www.moe.go.kr/boardCnts/listRenew.do?boardID=333&m=020501&s=moe#](https://www.moe.go.kr/boardCnts/listRenew.do?boardID=333&m=020501&s=moe#) 교육부 공지사항 목록에서 2026년 3월부터 현재까지의 자료 중 최신100건의 제목, 담당부서, 등록일을 엑셀로 정리하고 첨부된 PDF 파일도 같이 다운로드해줘.
Markdown
복사
•
수집 범위
◦
최근 보도자료 100건을 대상으로 함
◦
제목·담당 부서·등록일·링크를 엑셀로 정리함
◦
게시물에 첨부된 PDF 107개를 별도 폴더에 저장함
•
활용 방법
◦
교육부 공지사항 발표 동향을 정기적으로 확인함
◦
보도자료와 첨부 문서를 한꺼번에 검토함
◦
내려받은 PDF를 AI로 요약함
◦
시기별 정책 변화를 비교함
•
확인 사항
◦
보도자료 수와 첨부파일 수를 따로 계산하기
◦
같은 첨부파일이 중복 저장되었는지 확인하기
◦
파일명과 원문 게시물의 연결 관계 유지하기

2-2. 교육부 보도자료와 첨부파일 수집결과 비교(Antigraviy vs Codex vs ClaudeCode)

[크롤링 결과]
Antigraviy, Codex, ClaudeCode 3개에서 동시에 작업을 요청한 결과
1.
작업속도는 Antigraviy가 압도적으로 빠름
•
이는 제미나이 3.7flash가 압도적인 속도를 자랑하기 때문???
2.
작업 완료시점: Antigraviy >>>>>>>>>>>Codex>>ClaudeCode
•
클로드 코드는 자꾸 오류 발생, 오류 수정, 오류발생 프로세스 과정을 거치며, 가장 마지막에 작업이 종료됨(결과적으로 성공)
3.
작업 결과
•
Antigraviy, Codex, ClaudeCode 모두 오류없이 완벽하게 크롤링 작업 성공!(특히, 첨부파일까지)

2-3. 특정 키워드가 포함된 뉴스자료 수집(A.K.A 필터링 기능)

•
해당 작업의 목적: AISW동아리 학생들을 대상으로 최근 1개월간의 관련 업계의 Trend를 요약하고자 함
◦
타겟 웹사이트: https://www.aitimes.com/
◦
해당 사이트에서 ‘교육적인 관점에서 필요한 AI관련 기사만 필터링해서 크롤링 하는 것이 목적
◦
제목·언론사·날짜·링크를 정리함
◦
아래 예시프롬프트처럼 특정 주소를 한꺼번에 입력하고 필터링 형태로 작업지시
[예시 프롬프트]
https://www.aitimes.com/news/articleList.html?sc_multi_code=S2&view_type=sm https://www.aitimes.com/news/articleList.html?sc_sub_section_code=S2N51&view_type=sm https://www.aitimes.com/news/articleList.html?sc_section_code=S1N24&view_type=sm 위 3개의 섹션의 뉴스 기사중에서 ‘교육적인 관점에서’ 중요 기사만 크롤링할꺼야. 1. 기간: 오늘부터 한달전까지 2. 크롤링 영역:기사 제목, 핵심 키워드, 기사 내용 전체, 보도 매체, 날짜, 링크 3. 교육적인 관점의 기준: 혁신적 변화, AI관련 업계종사자라면 알아야 할 내용, 대학관련 내용, 모델 벤치마크 등
Markdown
복사
[크롤링 결과 확인]
•
이후 연계 작업
◦
핵심 키워드 워드 클라우드
◦
보고서 및 자료 시각화 등

2-4. 로그인이 필요한 사이트 수집

로그인 절차는 커뮤니티와 SNS가 동일함. 사이트별로 달라지는 것은 수집 항목과 확인해야 할 약관
로그인 처리 방식
•
사용자가 브라우저에서 직접 로그인함
•
아이디와 비밀번호를 에이전트에 전달하지 않음
•
로그인된 브라우저의 인증 상태를 그대로 이용함
•
2단계 인증과 추가 보안 확인은 사용자가 직접 처리함
사이트별 수집 항목과 활용
구분
수집 항목
활용
커뮤니티(네이버 카페 등)
게시글 제목, 작성자, 게시일, 본문, 원문 링크
관심사 분석, 반복 질문 확인, 불편 사항과 요구 파악
인스타그램
계정명, 본문, 좋아요 수, 게시일, 게시물 링크
해시태그별 게시물 흐름 확인, 소비자 반응 분석, 표현·콘텐츠 형식 비교
⚠️ 주의: 카페 운영정책과 회원 전용 게시물의 이용 범위 확인하기 / 로그인 상태여도 플랫폼 약관 확인하기 / 개인 계정 정보는 업무에 필요한 범위만 수집하기 / 작성자 권리와 개인정보 포함 여부 확인하기

Ⅲ. 에이전트의 작동 원리와 업무 맞춤화

3-1. AI와 코드의 역할 분담

담당
하는 일
AI(LLM코드)
사이트 구조 파악, 목록과 상세 페이지 구분, 페이지 이동 방법 판단, 수집 전략 결정, 사이트에 맞는 코드 작성, 오류 시 다른 방법 검토
코드(파이썬 기반)
정해진 규칙대로 반복 수집, 같은 형식으로 항목 추출, 데이터 형식 통일, 결과 파일 저장, 수집 건수 계산
✅ 역할 분담해야 하는 이유
•
유연한 판단이 필요한 작업은 AI가 담당함
•
반복성과 정확성이 필요한 작업은 코드가 담당함
•
즉, 판단은 AI가 담당하고 반복 실행과 정확성은 코드가 담당함

3-2. 사이트 정찰과 수집 전략 저장

이 Agent가 특별한 이유
•
보통 크롤링을 막고 있는지 허용하는지 robots.txt으로 확인가능
•
쿠팡은 이용약관에서 검색엔진을 제외한 자동화 수단의 데이터 수집을 금지하고 있으며, 봇 탐지 시스템으로 기술적 차단도 병행함.
◦
데이터가 필요하면 공식 Open API 등 허용된 경로를 먼저 확인해야 함.
◦
쿠팡은 AI 봇을 이름을 지목해서 따로 막고 있음. 주석까지 달아서 세 종류를 구분함
# Block OpenAI Model Training → GPTBot # Block ChatGPT Real-time User Browsing → ChatGPT-User # Block OpenAI SearchGPT Indexing → OAI-SearchBot
Markdown
복사
•
쿠팡의 웹 스크래핑 정책 확인 결과
3단계 구조
대상
처리
검색엔진 7종 (Googlebot 계열, NaverBot·Yeti, Bingbot, Daum·Daumoa)
상품·카테고리·검색결과 페이지만 허용, 장바구니·주문·판매자 데이터는 차단
OpenAI 봇 3종
전면 차단 (Disallow: /)
그 외 전부 (User-agent: *)
전면 차단 (Disallow: /)
•
이 Agent는 이런 사이트에 대한 우회방법을 제공하고 있음
◦
하지만 이런 우회방식에 대한 법적 책임이 발생할 수 있으므로 상황에 맞는 개인의 판단 필요

3-4. 교육용 자료를 위한 유튜버 댓글 크롤링

[미션 ]박위 유튜버의 ‘KTX 공익요원 저격 사건’을 바탕으로 해당 영상의 댓글 크롤링 시도하기
https://www.youtube.com/watch?v=a4EpCC5Leb0 해당 유튜브 영상의 댓글을 다음 조건에 맞게 크롤링할꺼야. 1.크롤링 요소: 댓글/작성날짜/댓글 핵심 키워드/긍정댓글인지 부정댓글인지 중립인지 분류 2.댓글의 댓글인 '댓글-대댓글'도 모두 동일하게 크롤링 3.과부하를 막기 위해 최대 500개까지의 댓글에 대해서만 위 작업 실행
Markdown
복사
1.
일반 클로드에서 요청한 결과?
•
10분 넘게 복잡한 작업을 이어가며 토큰을 소진하는 이름하여 ‘삽질’을 진행
•
어디까지 삽질하나 지켜봤는데, ‘페이지 스크립트 실행함’이라는 중간 작업을 계속 진행하는 것으로 추측됨
•
도구 호출횟수가 20회를 넘어가는 저 바보같은 모습
•
살벌한 작업 소요시간. 결국 20분 넘어가면서 강제 중지
2.
일반 GPT에서 요청한 결과?
•
분명 크롤링을 실행해달라고 했는데, 크롤링을 실행하는 방법을 알려줌-_-;;
•
다시 요청했더니, 브라우저를 실제 작동시켜 댓글을 수집하는 방식으로 진행함
•
몇 번의 삽질을 반복하며 토큰을 소진하고 있어, 결국 강제로 종료시킴
3. 이후 Antigravity, Codex, ClaudeCode에서 크롤링 전용 Agent를 사용해 각각 작업을 진행
4.
역시나 Antigravity의 작업 결과물이 가장 빠르게 완성됨
a.
확인결과 정확한 지침을 주지않았던 긍정/중립/부정 댓글 분류 예측이 상당히 부정확 했음
b.
부정적인 댓글을 ‘중립’적인 댓글로 예측하는 오류가 많이 발견 되었음

3-5. 로그인이 필요한 사이트에서의 크롤링

•
로그인 절차는 커뮤니티와 SNS가 동일함.
◦
사이트별로 달라지는 것은 수집 항목과 확인해야 할 약관임.
•
반드시 지킬 사항
◦
로그인 정보를 에이전트에 직접 전달하지 않고 사용자가 브라우저에서 로그인하기
◦
분석에 불필요한 개인정보는 수집하지 않기
◦
플랫폼 약관과 게시물 재사용 조건 확인하기
[미션] 테슬라 공식 까페(TKC)에서 ‘타이어’관련된 게시글과 댓글들을 모두 수합하여 분석하기
•
이 사이트는 네이버 로그인 후 가입을 해야 게시글을 볼 있으므로 해당 에이전트가 크롤링을 성공적으로 수행하는지 매우 흥미로운 미션이 될거라 기대되었음
[예시 프롬프트]
https://cafe.naver.com/f-e/cafes/26681849/menus/0 이 네이버 카페는 테슬라 관련 까페야. 전체 게시판 중에 '타이어'와 관련된 100건의 제목, 작성일, 조회수, 본문 텍스트, 댓글을 엑셀로 수집해줘. 특히 댓글과 대댓글도 빠짐없이 크롤링하고, 댓글과 대댓글은 100건의 제목에는 카운트 하지 않는방식이야.
Markdown
복사
•
여기서 핵심은 에이전트가 ‘로그인이 필요하다고 판단’되면 브라우저를 띄울 것인지 사용자에게 직접 요청함!
•
특이하게, Antigravity에서는 ‘로그인 없이’자동으로 게시글 크롤링을 완료하였다는 사실
•
네이버까페의 보안 권한 취약점(?)을 제대로 파고든 것 같은 느낌
[ 비로그인 공개 영역 ] ──▶ 네이버 모바일 검색 API (cafe-search-api) └─ 게시글 제목, 작성자, 작성일, 조회수, 댓글 수, 글 번호 제공 [ 회원 전용 보안 영역 ] ──▶ 개별 게시글 본문 및 댓글 API (cafe-articleapi) └─ 네이버 로그인 세션 토큰이 없으면 nid.naver.com(로그인창)으로 차단
Markdown
복사
•
안티그래비티가 제대로 게시판 본문과 댓글까지 크롤링 한 줄 알고 파일을 열어보았는데 결과는?
◦
게시물의 ‘제목’과 작성ID등은 제대로 추출하였지만 결국 로그인하지 않은 상태에서는 본문과 댓글을 크롤링할 수 없었음
•
결과적으로 Antigravity와 Codex모두 작업을 성공적으로 완료(클로드 코드는 토큰 압박으로 시도X)
◦
플랫폼마다, 또한 모델의 성능에 따라 동일한 미션이더라도 서로 다른 작업 프로세스를 가질 수 있다는 사실
◦
로그인 방식은 브라운저를 띄우기 때문에 ‘크롤링’에 보다 많은 시간과 토큰이 소요되는 듯
[실제 타이어 관련 게시글&댓글 크롤링 결과]
2026-09-05-naver-cafe-tire.xlsx
164.1 KiB

Ⅳ. 안전한 활용 방법& AI 시대의 일하는 방식

4-1. 크롤링의 법적·윤리적 판단 기준

•
크롤링 되는 것과 안되는 것을 이분법적으로 완벽하게 구분하는 것은 쉽지 않음
기준
확인할 것
접근 제한
이용약관의 자동 수집 금지 여부, robots.txt 접근 제한 표시, 로그인·기술적 차단 우회 여부
서버 부담
짧은 시간에 과도한 요청을 보내는지, 상대 서버 운영에 부담을 주는지
정보의 성격
개인정보·민감정보 포함 여부, 이름·연락처·계정 정보가 꼭 필요한지, 공개 정보의 재사용 조건
수집 분량
업무에 필요한 만큼만인지, 사이트 데이터베이스의 상당 부분을 복제하지 않았는지
이용 목적
내부 분석용인지, 원본 서비스를 대체·경쟁하려는 목적인지, 재판매·공개 계획이 있는지
수집 기록
누가 어떤 목적으로 수집했는지, 수집 날짜와 대상 URL, 문제 발생 시 범위와 과정을 확인할 수 있는지

4-2. 에이전트의 안전장치와 사용자의 책임

해당 에이전트 지원 기능
•
요청 사이에 적절한 간격을 둠
•
robots.txt를 확인함
•
개인정보로 보이는 항목을 사용자에게 알림
•
접근 차단을 발견하면 사용자에게 보고함
•
수집 건수와 누락 가능성을 보고함
•
차단된 접근을 계속하기 전에 사용자 확인을 받음
사용자가 판단할 사항
•
기술적으로 가능하다는 이유만으로 수집을 결정하지 않기
•
사이트 이용약관과 데이터 이용 조건 확인하기
•
업무·상업적 이용 전에 필요한 법률 검토 진행하기
영상의 설명은 일반적인 참고 정보이며 개별 사례에 대한 법률 자문이 아님. 실제 업무 적용 전 전문가 검토가 필요할 수 있음.

4-3. 결과 검증 체크리스트

검증 축
확인 항목
범위와 조건
요청한 기간·조건이 정확히 적용됐는지, 대상 사이트와 페이지가 맞는지
수집 건수
화면의 전체 건수와 수집 건수 비교, 페이지 이동 중 누락 여부
데이터 품질
상세 페이지 항목 반영 여부, 중복·깨진 글자·열 배치 오류, 빈 셀과 비정상적으로 긴 값
개인정보
개인정보·민감정보 포함 여부, 업무에 불필요한 개인정보 삭제
출처와 표본
원문 링크와 수집 날짜 기록 여부, 일부 데이터를 원문과 직접 대조하는 표본 검사

4-4. 바로 사용가능한 크롤링 전용 Agent 요청 템플릿

[수집 대상] 실제 목록이나 검색 결과의 URL [수집 범위] 기간 / 키워드 / 지역 / 직무 / 최대 건수 [목록 페이지 항목] 제목, 작성자, 날짜, 가격, 상태 등 필요한 열 [상세 페이지 항목] 본문, 자격 요건, 첨부파일 등 추가 항목 [결과 형식] 엑셀 / CSV / 마크다운 / PDF, 원문 링크와 수집 날짜 포함 [검증 조건] 중복 제거, 수집 건수와 누락 가능성 보고, 이용약관과 robots.txt 먼저 확인, 개인정보나 접근 제한 발견 시 작업 전에 알릴 것
Plain Text
복사