연구진이 복잡한 HTML 구조에서 뉴스 콘텐츠를 추출하는 데 어려움을 겪는 문제를 해결하기 위해 news-crawler-LM 모델을 개발했어요. 이 모델은 HTML을 텍스트와 JSON 형식으로 변환하며, 헤드라인, 작성자, 발행일, 본문 등의 정보를 추출합니다. 실험 결과, news-crawler-LM은 기존 방식보다 HTML-to-Markdown 및 HTML-to-JSON 추출 성능을 향상시켰어요.