HTMLサイト
商品一覧、ニュースサイト、ランキングサイト、情報ポータルなど、通常のWebページから必要な情報を取得できます。
CSS SelectorやXPathなどを利用して、「ページのどこから、何を取得するか」を定義できます。
Webサイト、公開API、各種オンラインサービスには、日々さまざまな情報が公開されています。
価格、商品情報、ニュース、気象情報、設備情報、証明書情報、ランキング、在庫状況――。
しかし、本当に価値があるのは「今表示されている情報」だけではありません。
WEB DATA COLLECTORは、Web上の情報を自動的に収集し、構造化して保存し、履歴として残し、さらに解析へつなげるためのデータ収集プラットフォームです。
単なるスクレイピングではなく、収集・構造化・履歴化・解析までを一つの流れとして扱うための汎用Webデータ収集基盤です。
通常のWeb検索では、その瞬間の情報を見ることしかできません。
WEB DATA COLLECTORでは、必要な情報を定期的に取得して保存できます。
例えば商品情報であれば、次のような情報を継続的に収集できます。
一度取得して終わるのではなく、再度取得した情報を履歴として残すことができるため、
「現在どうなっているか」だけでなくを確認できるデータになります。
Webページを、時間軸を持ったデータベースへ変える。それがWEB DATA COLLECTORの基本的な考え方です。
WEB DATA COLLECTORは、特定のWebサイトだけを対象にした専用スクレイピングツールではありません。現在のシステムでは、複数のデータ取得方式を共通の仕組みで扱えるよう設計されています。
商品一覧、ニュースサイト、ランキングサイト、情報ポータルなど、通常のWebページから必要な情報を取得できます。
CSS SelectorやXPathなどを利用して、「ページのどこから、何を取得するか」を定義できます。
JSON形式で公開されているAPIも収集対象にできます。
HTMLとJSON APIで別々のシステムを構築するのではなく、取得後は同じCollectorのデータとして管理できます。
Webページそのものだけではありません。SSL/TLS証明書から次の情報などを収集できます。
そのためWEB DATA COLLECTORは、情報収集だけでなくWebサイトの保守・監視にも応用できます。
ページをまたいだ情報も一つのデータへ。
Web上の情報は、一つのページだけに存在するとは限りません。
例えばオークションサイトでは、検索結果一覧に「商品名・価格・商品URL」があり、商品詳細ページに「説明・商品の状態」があり、さらに別ページに「入札履歴」が存在する場合があります。
WEB DATA COLLECTORでは、LIST → DETAIL → RELATEDという複数階層のページを順番にたどり、それぞれから取得した情報を最終的に一つのデータとして統合できます。
そのため、一覧ページだけを取得する単純なスクレイピングでは取得できない、より詳細なデータベースを作ることができます。
WEB DATA COLLECTORの大きな特徴の一つが、設定駆動型の設計です。
新しいサイトを追加するたびに、そのサイト専用のプログラムを一から作ることを前提としていません。
サイトごとの差異は主に、次の設定として定義します。
例えば、「このHTML要素の商品名を取得する」「この属性からURLを取得する」「このJSONの階層から値を取得する」「この値を整数に変換する」といった処理を組み合わせます。
これにより、一つのCollector EngineをさまざまなWebサイトやAPIへ応用できます。
Webページをそのまま保存するだけでは、後から活用するのは簡単ではありません。
WEB DATA COLLECTORでは、取得した情報を項目ごとに構造化できます。
文字列、数値、Boolean、URLなどとして扱えるため、その後の検索・並び替え・フィルタ・解析が容易になります。
TITLE
OLYMPUS OM-D E-M1
PRICE
33000
SHOT_COUNT
2000
DETAIL_URL
商品詳細URL
Webページは常に変化しています。
WEB DATA COLLECTORでは、取得データをSnapshotとして保存し、最新データと過去データを管理できます。
「今の値」だけではなく「どう変わってきたか」
を後から調べることができます。これは通常の検索エンジンやブックマークにはない、大きなメリットです。
一度設定した収集処理はスケジュール実行できます。毎回人がWebサイトを開いて確認する必要はありません。
収集処理はQueueとして管理されるため、複数ページを扱う処理や継続的なデータ収集にも対応しやすい構造になっています。
データ収集では、取得対象サイトへの過剰なアクセスを避けることも重要です。
WEB DATA COLLECTORにはリクエスト制御の仕組みがあり、HTTP 429、500、503などの一時的なエラーが発生した場合には、一定時間アクセスを抑制する仕組みが実装されています。
また、アクセス可能なホストを制限するAllowed Hostsの仕組みにより、意図しない接続先へのアクセスを防ぐ設計も取り入れています。
「取得できればよい」だけではなく、継続運用するための基盤を考えた設計です。
収集したデータを、そのまま保存するだけでなく、判断に使える情報へ変換します。
例えば商品説明に、
「シャッター回数は約5,700回です」
という文章があったとします。通常のHTML収集では、これは単なる説明文です。
解析機能を利用すると、その文章から、
という構造化された数値として抽出できます。
現在、正規表現による抽出や分類、特定キーワードの存在確認、キーワードに続く文字列・整数の取得などを組み合わせられる構造になっています。
という処理を一つのシステム内で行えます。
大量のデータを集めても、すべてを人が確認していては意味がありません。
収集結果にはNEW状態やお気に入り管理を利用できるため、次の情報を区別して管理できます。
さらに解析結果を組み合わせることで、将来的にはAIによる評価や優先順位付けへ発展させることもできます。
入口となる情報が違っても、収集・構造化・履歴化・解析という基本の仕組みは共通です。
現在のWEB DATA COLLECTORで実際に構築している代表的な用途です。
オークションサイトから、商品名、現在価格、商品説明、商品状態、詳細ページ、入札情報などを収集します。
さらに説明文を解析して、シャッター回数、動作確認の有無、ジャンク表記、型番、付属品などを構造化できます。
これを継続して蓄積すれば、「この機種はいくらで出品されることが多いか」「どの条件の商品が安いか」「過去と比較して相場が上がっているか」といった市場分析へ発展させることができます。
ニュースサイトや業界サイトを定期的に巡回し、タイトル、公開日時、URL、本文、カテゴリーなどを収集します。
複数サイトの情報を一つのデータベースに集約すれば、特定企業、製品、技術、地域などに関する情報を横断的に追跡できます。
さらに解析処理と組み合わせることで、「特定キーワードを含むニュースだけを抽出する」「新しく登場した話題を検出する」といった用途へ発展できます。
気象庁が公開しているJSONデータなどを定期的に取得できます。
一般的な天気サイトは「現在の予報を見る」ことが中心ですが、WEB DATA COLLECTORでは取得時点の情報を保存できます。
例えば、大阪府、香川県、中国地方、四国地方、近畿地方など複数地域をRuntime Parametersとして設定し、自動収集することもできます。
蓄積した情報は、農業、IoT、設備制御、需要予測、行動記録など別システムのデータと組み合わせて利用できます。
管理しているWebサイトが増えるほど、SSL証明書の管理も煩雑になります。
WEB DATA COLLECTORでは複数ドメインを登録し、SSL証明書情報を定期的に収集できます。
という変化を記録できます。
将来的に通知処理と組み合わせれば、「有効期限が30日未満になったサイトだけ通知する」といった保守監視システムとして利用できます。
ECサイトや公開商品情報から、商品価格、在庫状態、ランキング、販売状態、商品情報などを定期的に取得します。
Snapshotとして履歴を保存すれば、価格がいつ変わったか、いつ在庫切れになったか、ランキングがどう動いたかを確認できます。
競合調査、市場調査、商品企画などにも応用できます。
JSON APIに対応しているため、対象はWebコンテンツだけではありません。
外部サービスや設備がAPIを公開していれば、サーバー状態、IoTセンサー情報、サービス稼働状態、使用量、混雑情報、公共データなどを同じCollectorへ取り込むことができます。
Web、API、IoTなど、取得元が異なる情報を共通データとして蓄積できる点は、SWPFとの連携にも適した特徴です。
AIは質問された瞬間だけ情報を調べるよりも、必要なデータがあらかじめ整理されている方が、より高度な判断に利用できます。
WEB DATA COLLECTORによって、収集 → 構造化 → 履歴化 → 解析 → AI評価というデータパイプラインを構築できます。
例えば中古商品の場合、「安い」という理由だけでは本当に買うべき商品か判断できません。
価格、状態、使用回数、付属品、動作確認、過去相場などをCollector側で整理した上でAIに渡すことで、「この商品は条件に対して割安」「価格は安いがリスクが高い」といった、より実用的な評価へ発展させることができます。
AIそのものだけでなく、AIが判断するための良質なデータを継続的に作る。
これもWEB DATA COLLECTORの重要な役割です。
WEB DATA COLLECTORは、特定用途だけの完成されたサービスではありません。データ取得方法と解析方法を定義することで、さまざまな用途へ展開できるデータ収集プラットフォームです。
商品価格を調べる。
ニュースを追跡する。
天気情報を蓄積する。
Webサイトを監視する。
設備情報を記録する。
AIに判断させる。
入口となるデータは違っていても、その基本となる仕組みは共通です。
人が毎日Webサイトを巡回して確認している情報。
確認したときには、前の状態が分からなくなっている情報。
複数のサイトに分散している情報。
文章の中に埋もれていて検索できない情報。
WEB DATA COLLECTORは、そうした情報を、
「見るだけの情報」から「蓄積して活用できるデータ」へ変えていきます。