データセット
データセットの解説資料(PDF・PowerPoint)
- Iris データセット [PDF], [パワーポイント]
- Titanic データセット [PDF], [パワーポイント]
- CIFAR-10 データセット [PDF], [パワーポイント]
- CIFAR 100, MNIST, Fashion MNIST データセット [PDF], [パワーポイント]
テーブルデータ・公共データ・API
- R システムのパッケージに付属のデータセットから SQLite 3 データベースを生成(R システム,SQLite3 を使用)
【要約】RシステムとSQLite3を用い、irisやdiamonds、時系列や緯度経度などのR付属データセットからSQLite3データベース(rdataset)を生成する手順を解説しています。次のデータから SQLite 3 データベースを生成する.
- 一般: iris, diamonds, Indometh
- 時系列: Lai2005fig4, meteoandes, economics , nhtemp
- 緯度・経度: seals
- Iris データセット(Python を使用)
- Titanic データセット(Python を使用)
- Python の seaborn, scikits.learn のデータセット(Python,scikit-learn, seaborn を使用)
- 政府統計の総合窓口, 市町村の人口総数(Excel ファイルのダウンロード,SQLite 3 データベースの生成)
公式ページ: 政府統計の総合窓口 (e-stat) http://www.e-stat.go.jp/estat/html/spec.html
【要約】政府統計窓口(e-stat)のExcelデータをダウンロードし、csvkit等を用いてCSV形式に変換後、SQLite3データベースを生成する手順を説明。データ加工に必要なツールの導入方法も解説。 - 政府統計 e-Stat から API を用いてデータ取得
【要約】政府統計(e-Stat)のAPI機能を利用し、データ取得を行う手順を解説。e-Statへのユーザ登録からアプリケーションIDの取得、APIリクエストURLの作成・アクセスまでを具体的に説明しています。
- OpenStreetMap のデータを扱う(Windows 上)
【要約】Ubuntu環境でOpenStreetMapデータを扱う手順を解説。システム更新からosmosis等のツール導入、緯度経度を指定して特定地域データを切り出す方法を具体的に紹介しています。 - 外国為替データ(時系列データ)の情報源の紹介
【要約】外国為替の時系列データ取得元として、みずほ銀行、日本銀行の統計データ検索サイト、米国FREDの3つを紹介。各サイトからCSVファイルをダウンロードする具体的な手順を解説しています。 - 福岡市バス停(2013 年作成)
画像・モーションデータ(分類・顔認識など)
- npz 形式のMNIST データセットを,CSVファイルに変換
【要約】npz形式のMNISTデータセットをダウンロード・解凍し、Webページ上のソースコードをビルド・実行してCSVファイルへと変換し、その出力結果の中身を確認する一連の手順を解説しています。 - MNIST データセット(Python を使用)
- Fashion MNIST データセット(Python を使用)
- くずし字 MNIST データセット(Kuzushiji-MNIST データセット)のダウンロード,画像分類の学習,画像分類の実行
- CIFAR-10 データセット(Python を使用)
- CIFAR-100 データセット(Python を使用)
- SVHN データセット(Python を使用)
- CelebA (Large-scale CelebFaces Attributes) データセットのダウンロード
- UTKFace (Large Scale Face Dataset) の Aligned & Cropped Faces データのダウンロードと確認
- LFW 顔画像データセットのダウンロードと確認(Python,scikit-learn を使用)
- CMUモーションキャプチャデータベースの BVH ファイル形式版
自然言語処理データセット
- ipadic 辞書(CSV ファイル)から SQLite 3 データベースを生成(Ubuntu 上)
【要約】Ubuntu上でmecab-ipadic-utf8パッケージのIPA辞書を利用し、まずCSVファイルを生成してから、それをインポートしてSQLite 3データベースを構築する手順を解説します。 - 日本語版 Wikipedia ダンプのダウンロード,ファイル分割(XMLファイル)(Python を使用)
- 英語版 Wikipedia ダンプのダウンロード,ファイル分割(XMLファイル)(Python を使用)
テキストデータをトークン化(tokenize)するときは,TensorFlow データセットのロード時に,「mnist/subword32k」のように指定する.