kakaku.comのカテゴリランキング情報収集方法
以前、amazon.co.jpのランキング情報取得方法について メモ を取っていましたが、今回はkakaku.comのランキング情報も同じように取得してみたいと思います。 kakaku.comでランキング情報を収集してみる さて、前置きは置いておいて早速やってみましょう。 今回は、kakaku.comの NASカテゴリランキングページ のランキング情報を取得してみます。こちらのページですね。 HTMLのソースコードを確認してみると、こんな感じです。 構造を見ていくと、 こちらのように、各順位ごとに<div class="rkgBox noGraph withReview">ないし、<div class="rkgBox noGraph">で構造が作られていることがわかるので、find_allでこの属性を取り出します。こいつを、1要素=eleとしてbeautifulsoupで取り出して、各々の中身をget_infoで解析してやるという流れになります。 各要素の中身は、 といった感じになっており、 <span class =" num "> にランキング、 <span class =" rkgBoxNameMaker "> にメーカー名、 <span class =" rkgBoxNameItem "> に製品名、 <span class =" price " > に最低価格が記載されていますので、get_infoの中で取り出してやります。 取り出したデータは、pandaでcsvファイルとして保存します。 コードはこんな感じ。 #!/usr/bin/python import urllib3 from bs4 import BeautifulSoup import time import datetime import pandas as pd uri_attention = 'https://kakaku.com/pc/nas/ranking_7731/hot/' uri_sales = 'https://kakaku.com/pc/nas/rank...