작성자: 김성민 날짜: 2023년 10월 24일
기획팀에서 다른 사이트의 정보를 가져오고 싶다고 요청했다.
이럴 경우 웹 스크래핑 or 크롤링을 하면 된다
스크래핑 크롤링 규칙은 각 회사마다 제공하는 조건이 있으니 만약 해당 회사가 허용하지 않는 데이터를 스크래핑 크롤링 했을 경우 법적 소송까지 이어진다.
(크롤링을 통해 매출이 증가하면 패소한다 한다.)
실제로 잡코리아에서 사람인을 소송해서 120억원 사람인에서 지불한 이력이 있다.[관련 기사]

Untitled
사이트 크롤링 조건은 [해당 서비스 home url]/robots.txt 에서 확인할 수 있다.

Model에 담아 출력, API를 호출해서 출력 두 가지를 구현했다.
실시간으로 변하는 데이터면 API를 통해 호출하는 것이 좋을 것이고
그것이 아니라면 Model에 담아 출력하는 것이 좋을 것이다.
상황에 맞게 사용하면 된다.
먼저 크롤링을 하려면 jsoup이라는 라이브러리를 사용 해야 한다.
selenium이라는 라이브러리도 있지만 이 라이브러리는 chorme 드라이버도 설치 해야 해서 선택하지 않았다. 예제 파일에는 Test 코드로 존재하니 참고하면 되겠다.