COLLECT × STRUCTURE × HISTORY × ANALYZE

Webの情報を「見る」から
「蓄積して活用する」へ。

Webサイト、公開API、各種オンラインサービスには、日々さまざまな情報が公開されています。

価格、商品情報、ニュース、気象情報、設備情報、証明書情報、ランキング、在庫状況――。

しかし、本当に価値があるのは「今表示されている情報」だけではありません。

昨日と何が変わったのか。 いつ変化したのか。 どの情報を注目すべきなのか。 蓄積したデータから何が分かるのか。

WEB DATA COLLECTORは、Web上の情報を自動的に収集し、構造化して保存し、履歴として残し、さらに解析へつなげるためのデータ収集プラットフォームです。

CONCEPT

Web上に分散する情報を、継続して使えるデータへ。

単なるスクレイピングではなく、収集・構造化・履歴化・解析までを一つの流れとして扱うための汎用Webデータ収集基盤です。

01収集COLLECT
→
02構造化STRUCTURE
→
03履歴保存HISTORY
→
04解析ANALYZE
→
05活用ACT
DATABASE

Webの情報を、自分だけのデータベースへ

通常のWeb検索では、その瞬間の情報を見ることしかできません。

WEB DATA COLLECTORでは、必要な情報を定期的に取得して保存できます。

例えば商品情報であれば、次のような情報を継続的に収集できます。

  • 商品名
  • 価格
  • 出品状態
  • 商品説明
  • 詳細ページ
  • 入札情報
  • 更新日時

一度取得して終わるのではなく、再度取得した情報を履歴として残すことができるため、

「現在どうなっているか」だけでなく
「これまでどう変化してきたか」

を確認できるデータになります。

Webページを、時間軸を持ったデータベースへ変える。

それがWEB DATA COLLECTORの基本的な考え方です。

DATA SOURCES

さまざまなWebデータを一つの仕組みで

WEB DATA COLLECTORは、特定のWebサイトだけを対象にした専用スクレイピングツールではありません。現在のシステムでは、複数のデータ取得方式を共通の仕組みで扱えるよう設計されています。

HTML

HTMLサイト

商品一覧、ニュースサイト、ランキングサイト、情報ポータルなど、通常のWebページから必要な情報を取得できます。

CSS SelectorやXPathなどを利用して、「ページのどこから、何を取得するか」を定義できます。

{ }

JSON API

JSON形式で公開されているAPIも収集対象にできます。

  • 気象情報
  • 検索API
  • 行政オープンデータ
  • IoT API
  • 外部サービスAPI
  • 各種REST API

HTMLとJSON APIで別々のシステムを構築するのではなく、取得後は同じCollectorのデータとして管理できます。

TLS

SSL証明書

Webページそのものだけではありません。SSL/TLS証明書から次の情報などを収集できます。

  • 有効期限
  • 残り日数
  • 発行者
  • 対象ドメイン
  • SAN
  • 証明書シリアル番号
  • 署名アルゴリズム
  • SHA-256 Fingerprint

そのためWEB DATA COLLECTORは、情報収集だけでなくWebサイトの保守・監視にも応用できます。

MULTI STEP

LIST → DETAIL → RELATED

ページをまたいだ情報も一つのデータへ。

Web上の情報は、一つのページだけに存在するとは限りません。

例えばオークションサイトでは、検索結果一覧に「商品名・価格・商品URL」があり、商品詳細ページに「説明・商品の状態」があり、さらに別ページに「入札履歴」が存在する場合があります。

WEB DATA COLLECTORでは、LIST → DETAIL → RELATEDという複数階層のページを順番にたどり、それぞれから取得した情報を最終的に一つのデータとして統合できます。

そのため、一覧ページだけを取得する単純なスクレイピングでは取得できない、より詳細なデータベースを作ることができます。

LIST一覧ページ
↓
DETAIL詳細ページ
↓
RELATED関連ページ
↓
ONE DATA統合データ
CONFIGURATION DRIVEN

プログラムを書くのではなく「収集方法を定義する」

WEB DATA COLLECTORの大きな特徴の一つが、設定駆動型の設計です。

サイトごとの差異を設定化

新しいサイトを追加するたびに、そのサイト専用のプログラムを一から作ることを前提としていません。

サイトごとの差異は主に、次の設定として定義します。

URL TemplateAccess DefinitionExtraction DefinitionRuntime ParametersSearch Profile

処理を組み合わせる

例えば、「このHTML要素の商品名を取得する」「この属性からURLを取得する」「このJSONの階層から値を取得する」「この値を整数に変換する」といった処理を組み合わせます。

これにより、一つのCollector EngineをさまざまなWebサイトやAPIへ応用できます。

STRUCTURED DATA

必要な情報だけを、構造化して保存

Webページをそのまま保存するだけでは、後から活用するのは簡単ではありません。

WEB DATA COLLECTORでは、取得した情報を項目ごとに構造化できます。

文字列、数値、Boolean、URLなどとして扱えるため、その後の検索・並び替え・フィルタ・解析が容易になります。

TITLE
OLYMPUS OM-D E-M1

PRICE
33000

SHOT_COUNT
2000

DETAIL_URL
商品詳細URL
SNAPSHOT

変化を履歴として残す

Webページは常に変化しています。

商品の価格が変わる掲載内容が更新される新しいニュースが追加される設備の状態が変わる証明書の有効期限が近づく

WEB DATA COLLECTORでは、取得データをSnapshotとして保存し、最新データと過去データを管理できます。

「今の値」だけではなく「どう変わってきたか」

を後から調べることができます。これは通常の検索エンジンやブックマークにはない、大きなメリットです。

AUTOMATION

定期収集を自動化

一度設定すれば、自動で継続

一度設定した収集処理はスケジュール実行できます。毎回人がWebサイトを開いて確認する必要はありません。

  • 毎朝取得
  • 1時間ごとに確認
  • 毎日決まった時間に収集
  • 定期的に証明書情報を確認

Queueで継続処理

収集処理はQueueとして管理されるため、複数ページを扱う処理や継続的なデータ収集にも対応しやすい構造になっています。

OPERATION

Webサイトに負荷をかけにくい収集設計

データ収集では、取得対象サイトへの過剰なアクセスを避けることも重要です。

WEB DATA COLLECTORにはリクエスト制御の仕組みがあり、HTTP 429、500、503などの一時的なエラーが発生した場合には、一定時間アクセスを抑制する仕組みが実装されています。

また、アクセス可能なホストを制限するAllowed Hostsの仕組みにより、意図しない接続先へのアクセスを防ぐ設計も取り入れています。

「取得できればよい」だけではなく、継続運用するための基盤を考えた設計です。
ANALYSIS

集めるだけではなく「解析する」

収集したデータを、そのまま保存するだけでなく、判断に使える情報へ変換します。

例えば商品説明に、

「シャッター回数は約5,700回です」

という文章があったとします。通常のHTML収集では、これは単なる説明文です。

解析機能を利用すると、その文章から、

shot_count = 5700

という構造化された数値として抽出できます。

現在、正規表現による抽出や分類、特定キーワードの存在確認、キーワードに続く文字列・整数の取得などを組み合わせられる構造になっています。

Webデータを収集する↓必要な情報を抽出する↓判断に使えるデータへ変換する

という処理を一つのシステム内で行えます。

FOCUS

「新しい情報」と「重要な情報」を見つけやすく

大量のデータを集めても、すべてを人が確認していては意味がありません。

収集結果にはNEW状態やお気に入り管理を利用できるため、次の情報を区別して管理できます。

  • 新しく発見したデータ
  • 継続して確認したいデータ
  • 注目しているデータ

さらに解析結果を組み合わせることで、将来的にはAIによる評価や優先順位付けへ発展させることもできます。

1000件集めて
1000件読む
ではなく1000件の中から
確認すべき10件を見つける。

WEB DATA COLLECTORが目指しているのは、そのための情報基盤です。

USE CASES

応用事例

入口となる情報が違っても、収集・構造化・履歴化・解析という基本の仕組みは共通です。

01

オークション・中古商品の市場調査

現在のWEB DATA COLLECTORで実際に構築している代表的な用途です。

オークションサイトから、商品名、現在価格、商品説明、商品状態、詳細ページ、入札情報などを収集します。

さらに説明文を解析して、シャッター回数、動作確認の有無、ジャンク表記、型番、付属品などを構造化できます。

これを継続して蓄積すれば、「この機種はいくらで出品されることが多いか」「どの条件の商品が安いか」「過去と比較して相場が上がっているか」といった市場分析へ発展させることができます。

02

ニュース・業界情報の定点観測

ニュースサイトや業界サイトを定期的に巡回し、タイトル、公開日時、URL、本文、カテゴリーなどを収集します。

複数サイトの情報を一つのデータベースに集約すれば、特定企業、製品、技術、地域などに関する情報を横断的に追跡できます。

さらに解析処理と組み合わせることで、「特定キーワードを含むニュースだけを抽出する」「新しく登場した話題を検出する」といった用途へ発展できます。

03

気象情報の長期保存・分析

気象庁が公開しているJSONデータなどを定期的に取得できます。

一般的な天気サイトは「現在の予報を見る」ことが中心ですが、WEB DATA COLLECTORでは取得時点の情報を保存できます。

例えば、大阪府、香川県、中国地方、四国地方、近畿地方など複数地域をRuntime Parametersとして設定し、自動収集することもできます。

蓄積した情報は、農業、IoT、設備制御、需要予測、行動記録など別システムのデータと組み合わせて利用できます。

04

SSL証明書の有効期限監視

管理しているWebサイトが増えるほど、SSL証明書の管理も煩雑になります。

WEB DATA COLLECTORでは複数ドメインを登録し、SSL証明書情報を定期的に収集できます。

残り90日→残り60日→残り30日

という変化を記録できます。

将来的に通知処理と組み合わせれば、「有効期限が30日未満になったサイトだけ通知する」といった保守監視システムとして利用できます。

05

価格・在庫・ランキングの変化を追跡

ECサイトや公開商品情報から、商品価格、在庫状態、ランキング、販売状態、商品情報などを定期的に取得します。

Snapshotとして履歴を保存すれば、価格がいつ変わったか、いつ在庫切れになったか、ランキングがどう動いたかを確認できます。

競合調査、市場調査、商品企画などにも応用できます。

06

公開データを利用した設備・サービス監視

JSON APIに対応しているため、対象はWebコンテンツだけではありません。

外部サービスや設備がAPIを公開していれば、サーバー状態、IoTセンサー情報、サービス稼働状態、使用量、混雑情報、公共データなどを同じCollectorへ取り込むことができます。

Web、API、IoTなど、取得元が異なる情報を共通データとして蓄積できる点は、SWPFとの連携にも適した特徴です。

07

AIのための継続的なデータ収集基盤

AIは質問された瞬間だけ情報を調べるよりも、必要なデータがあらかじめ整理されている方が、より高度な判断に利用できます。

WEB DATA COLLECTORによって、収集 → 構造化 → 履歴化 → 解析 → AI評価というデータパイプラインを構築できます。

例えば中古商品の場合、「安い」という理由だけでは本当に買うべき商品か判断できません。

価格、状態、使用回数、付属品、動作確認、過去相場などをCollector側で整理した上でAIに渡すことで、「この商品は条件に対して割安」「価格は安いがリスクが高い」といった、より実用的な評価へ発展させることができます。

AIそのものだけでなく、AIが判断するための良質なデータを継続的に作る。

これもWEB DATA COLLECTORの重要な役割です。

DATA PIPELINE

一つのCollectorから、さまざまな用途へ

WEB DATA COLLECTORは、特定用途だけの完成されたサービスではありません。データ取得方法と解析方法を定義することで、さまざまな用途へ展開できるデータ収集プラットフォームです。

WebサイトJSON APISSL証明書
↓WEB DATA COLLECTOR↓
収集↓構造化↓履歴保存↓解析↓検索・比較・監視↓AI・通知・自動制御

商品価格を調べる。

ニュースを追跡する。

天気情報を蓄積する。

Webサイトを監視する。

設備情報を記録する。

AIに判断させる。

入口となるデータは違っていても、その基本となる仕組みは共通です。

WEB DATA COLLECTOR

Webには、まだ活用されていないデータがある。

人が毎日Webサイトを巡回して確認している情報。

確認したときには、前の状態が分からなくなっている情報。

複数のサイトに分散している情報。

文章の中に埋もれていて検索できない情報。

WEB DATA COLLECTORは、そうした情報を、

「見るだけの情報」から「蓄積して活用できるデータ」へ変えていきます。
集める。残す。比較する。解析する。そして、次の判断につなげる。

WEB DATA COLLECTOR
Webの情報を、価値あるデータへ。

WEB DATA COLLECTOR
Powered by SWPF