광고·메뉴 빼고 본문만 가져와요
Crawl4AI로 웹페이지를 AI용 글로 긁기
크롤링은 프로그램이 웹페이지를 대신 열어 내용을 가져오는 거예요. Crawl4AI는 가져온 내용을 AI가 바로 읽기 좋은 마크다운으로 정리해 줘서, 자료 조사나 사내 챗봇 재료 모으기에 많이 써요.
진짜 브라우저를 뒤에서 몰래 띄워 읽기 때문에, 자바스크립트로 그려지는 요즘 사이트도 잘 가져와요.
1단계설치하기
- 패키지를 깔아요.
pip install -U crawl4ai
- 뒤에서 쓸 브라우저를 준비해요.
crawl4ai-setup
- 설치가 제대로 됐는지 검사해요.
crawl4ai-doctor
- 브라우저 준비가 실패하면 공식 안내대로 직접 깔아요: python -m playwright install --with-deps chromium
2단계명령 한 줄로 페이지 하나 긁기
- 주소를 주고 마크다운으로 받아요. 결과를 파일로 남기려면 뒤에 > 파일이름 을 붙이세요.
crwl https://example.com -o markdown > page.md
- 문서 사이트처럼 여러 쪽을 따라가며 모을 땐 최대 쪽수를 꼭 정해요.
crwl https://docs.crawl4ai.com --deep-crawl bfs --max-pages 10
3단계파이썬에서 불러 저장하기
- 아래를 grab.py로 저장해요. 주소 목록을 돌며 페이지마다 .md 파일로 남겨요.
import asyncio from pathlib import Path from crawl4ai import AsyncWebCrawler URLS = [ "https://example.com", ] async def main(): out = Path("긁은글") out.mkdir(exist_ok=True) async with AsyncWebCrawler() as crawler: for i, url in enumerate(URLS, 1): result = await crawler.arun(url=url) if not result.success: print("실패:", url, result.error_message) continue (out / f"{i:02d}.md").write_text(str(result.markdown), encoding="utf-8") print("저장:", url) asyncio.run(main()) - 실행해요.
python3 grab.py
- AI 모델을 붙여 '가격만 뽑아 줘' 같은 추출도 할 수 있는데, 모델 설정이 따로 필요해요. 먼저 마크다운 저장부터 익숙해지세요.
긁기 전에 꼭
사이트 이용약관과 robots.txt 확인 — 주소 뒤에 /robots.txt 를 붙이면 크롤링을 막은 곳이 보여요.
한 번에 너무 많이 긁지 않기 — 남의 서버에 부담을 줘요. 쪽수 제한을 걸어 두세요.
가져온 글의 저작권은 원래 주인 것 — 내부 참고용으로 쓰고, 그대로 다시 올리지 마세요.

복사해서 붙이다 광고 문구까지 딸려 오던 날들은 끝이에요. 대신 약관은 꼭 읽고요.
출처 (2026-09-30 확인)
GitHub unclecode/crawl4ai (Apache-2.0, 2026-09-23 v0.9.4) — https://github.com/unclecode/crawl4ai
Crawl4AI 공식 문서 — https://docs.crawl4ai.com
GitHub unclecode/crawl4ai (Apache-2.0, 2026-09-23 v0.9.4) — https://github.com/unclecode/crawl4ai
Crawl4AI 공식 문서 — https://docs.crawl4ai.com