Programming/Python

파이썬으로 HTML 파싱하기

쌍쌍바나나 2017. 2. 7. 20:38
반응형

웹페이지는 HTML로 작성이 되어있고,  HTML은 element와 attribute로 구성되어 있다. 


HTML에서 ‘id가 foo인 요소에 포함되어 있는 텍스트를 가져와’라는 규칙으로 필요한 정보를 추출할 수 있다.

하지만 실제로 제대로 된 형태를 갖추지 못했기 때문에 HTML의 요소를 tree 형태로 변환해서 쉽게 접근이 가능하게 해주는 BeautifulSoup라이브러리를 사용하면 쉽다. 

파이썬에서 HTML을 파싱하기 위해서는 BeautifulSoup, requests, html5lib이 필요하다. 파이썬에서 기본적으로 제공하는 라이브러리인 HTML parser는 완벽한 HTML 구조가 아니면 제대로 작동하지 않기 때문에 html5lib이 필요하다. 


$ pip install beautifulsoup4

$ pip install requests

$ pip install html5lib


아래 간단한 예제를 통해서 HTML에서 필요한 요소를 가져오면 된다. 아래 내용을 바탕으로 응용을 하면 된다. 


반응형
  • 현재글파이썬으로 HTML 파싱하기