-
00
ビッグデータ史学設計(テキストマイニング) — 概要
大量の歴史テキストを計算的に扱うビッグデータ史学の設計、コーパス構築・テキストマイニング・統計分析・機械学習による歴史研究の全体を見渡す入門ガイド
-
01
ビッグデータ史学とは — 計算による歴史研究
デジタルヒストリー、遠読、大量テキストの計算分析、カルチャロミクス、量的転回、方法と射程
-
02
遠読と精読 — スケールを変える読解
モレッティの遠読(distant reading)、マクロ分析、精読との補完、パターン発見、仮説生成と検証
-
03
歴史コーパスの構築 — 分析対象を作る
コーパスデザイン、収録範囲、代表性、サンプリング、メタデータ、著作権、バランス、時系列の連続性
-
04
テキストのデジタル化 — 史料を機械可読に
スキャンとOCR、翻刻、構造化、文字コード、旧字体・異体字、デジタル化の誤りと品質管理
-
05
OCRとHTR — 活字と手書きの文字認識
光学文字認識、手書き文字認識(HTR)、Transkribus、くずし字認識、学習モデル、認識精度の評価
-
06
くずし字認識 — 日本の古典籍を読む
くずし字OCR、KuroNet、字形の多様性、変体仮名、AIによる翻刻、翻刻支援と人手校正の協働
-
07
テキストの正規化 — 表記ゆれを整える
正規化、旧字新字変換、異表記統一、句読点補完、トークン化前処理、歴史的表記の扱い
-
08
形態素解析 — 単語への分割と品詞付与
トークン化、形態素解析器、古文用辞書、品詞タグ付け、未知語処理、歴史的日本語への対応
-
09
分かち書きと言語処理 — 前処理の基礎
分かち書き、ストップワード、ステミング・レンマ化、n-gram、前処理パイプライン、言語依存性
-
10
単語頻度分析 — もっとも基本的な計量
頻度表、相対頻度、ジップの法則、特徴語抽出、時系列頻度、頻度変化からの読み取り
-
11
共起分析 — 語と語のつながり
共起頻度、コロケーション、共起ネットワーク、相互情報量、文脈語、概念の関連構造の可視化
-
12
KWICとコンコーダンス — 文脈の中の語
キーワード・イン・コンテキスト、用例検索、コンコーダンサ、語の用法分析、精読への橋渡し
-
13
特徴語抽出 — 際立つ語を見つける
TF-IDF、対数尤度比、カイ二乗、特徴度、コーパス間比較、時代・著者を特徴づける語
-
14
ネットワーク分析の基礎 — 関係を測る
ノードとエッジ、次数・中心性、ネットワーク密度、可視化、歴史的関係データへの応用
-
15
人的ネットワーク分析 — 人と人のつながり
書簡ネットワーク、共著・師弟、媒介中心性、コミュニティ検出、歴史的社会関係の構造分析
-
16
引用・参照ネットワーク — 知の伝播
引用ネットワーク、テキスト間参照、影響関係、知識伝播の可視化、テキスト再利用の追跡
-
17
テキスト再利用検出 — 借用と引用の発見
テキストリユース、n-gram一致、類似文検出、盗用・引用・改変、文献間の依存関係の解明
-
18
主題モデル(LDA) — 潜在的主題の抽出
LDA、潜在ディリクレ配分、主題と文書の分布、ハイパーパラメータ、抽出された主題の解釈と命名
-
19
主題の時系列分析 — 話題の盛衰を追う
動的主題モデル、主題割合の推移、話題の出現と衰退、時代と主題の対応、言説の変遷の計量
-
20
文書分類 — テキストの自動仕分け
教師あり分類、特徴量設計、ナイーブベイズ・SVM、ジャンル・時代・著者分類、評価指標
-
21
クラスタリング — テキストの自動グループ化
教師なし学習、k-means、階層クラスタリング、文書類似度、クラスタの解釈、探索的分析
-
22
感情分析 — テキストの情動を測る
センチメント分析、感情辞書、極性、歴史テキストへの適用の難しさ、時代差と語義変化の影響
-
23
著者推定 — 文体から書き手を探る
スタイロメトリー、機能語頻度、デルタ法、著者判別、真贋・帰属問題、共著・代作の検出
-
24
文体計量 — 書きぶりを数える
文長・語彙多様性、タイプトークン比、機能語分布、文体指標、時代・ジャンルの文体変化
-
25
語義の変化 — 意味の歴史を追う
通時的語義変化、意味のドリフト、通時的単語埋め込み、語の用法の変遷、概念史との接続
-
26
単語埋め込み — 語をベクトルにする
word2vec、分散表現、意味の類似、ベクトル演算、歴史コーパスでの学習、意味空間の可視化
-
27
通時的埋め込み — 意味変化の計量
時代別埋め込み、意味変化の定量化、埋め込みの整列、語義ドリフトの検出、概念の移動の追跡
-
28
固有表現抽出 — 人名・地名・日付の自動抽出
NER、固有表現認識、人名・地名・組織・年月日、歴史テキストへの適用、抽出結果の構造化
-
29
エンティティリンキング — 実体への名寄せ
同名異人の判別、典拠への紐付け、地名解決、知識ベース連携、名寄せの曖昧性処理
-
30
関係抽出 — テキストから関係を取り出す
人物間関係、出来事と参加者、関係抽出、イベント抽出、構造化知識の自動構築
-
31
イベント抽出 — 出来事の自動同定
出来事の抽出、時間・場所・参与者、年表の自動生成、歴史的事件のデータ化、時系列構築
-
32
時間表現の処理 — 日付と期間の正規化
時間表現抽出、和暦・元号の変換、相対時間、TimeML、時間軸へのマッピング、暦の換算
-
33
知識グラフ構築 — 歴史知識のネットワーク化
エンティティと関係のグラフ、RDF、知識ベース、人物・出来事・場所の連結、推論と検索
-
34
構造化データ化 — 非構造テキストの表化
テキストからテーブルへ、属性抽出、データベース化、プロソポグラフィデータ、集計可能化
-
35
プロソポグラフィと計量 — 集団経歴の分析
経歴データベース、集団的属性分析、エリートの統計、職歴パターン、大量伝記データの解析
-
36
歴史統計の基礎 — 数量史料の分析
記述統計、時系列、指数、実質化、統計的検定、歴史統計の作成と批判的利用
-
37
時系列分析 — 歴史データの時間変動
トレンドと周期、移動平均、変化点検出、系列相関、物価・人口・気候の時系列分析
-
38
回帰分析 — 要因と結果の推定
線形回帰、重回帰、説明変数、係数の解釈、歴史データの回帰、因果推論の限界
-
39
多変量解析 — 複数変数の同時分析
主成分分析、対応分析、因子分析、次元削減、多変量パターン、考古・歴史データへの応用
-
40
対応分析 — カテゴリの布置
コレスポンデンス分析、行と列の同時布置、型式と遺跡、著者と語彙、質的データの可視化
-
41
ベイズ統計と歴史 — 不確実性の推論
ベイズ推論、事前分布、事後分布、少数データへの対応、年代・人口推定、不確実性の定量化
-
42
欠損と偏りへの対処 — 不完全データの扱い
史料の残存バイアス、生存バイアス、欠損データ、補完、代表性の評価、偏りを踏まえた解釈
-
43
サンプリングと代表性 — 一部から全体を推す
標本抽出、母集団の推定、コーパスの偏り、抽出設計、残存史料の代表性問題
-
44
機械学習の基礎 — 歴史研究への導入
教師あり・教師なし、訓練とテスト、過学習、特徴量、モデル評価、歴史データでの機械学習
-
45
深層学習と歴史テキスト — ニューラルモデル
ニューラルネットワーク、RNN・LSTM、系列処理、事前学習、歴史テキストへの適用と課題
-
46
大規模言語モデルと史学 — LLMの活用
大規模言語モデル、要約・分類・抽出、翻刻・現代語訳支援、幻覚のリスク、検証の必要
-
47
画像認識と歴史資料 — ビジュアルの計量
画像分類、物体検出、図像の自動分析、絵画・地図・写真の計量、視覚的大量分析
-
48
手書き資料の一括処理 — 大量文書の機械読取
HTRパイプライン、レイアウト解析、行検出、大量古文書の翻刻、人手校正との組合せ
-
49
データ可視化 — 分析結果を見せる
グラフ・チャート、ネットワーク図、ヒートマップ、時系列可視化、探索的可視化、伝達の設計
-
50
インタラクティブ可視化 — 探索できる図
ダッシュボード、ズーム・フィルタ、動的グラフ、ウェブ可視化、利用者による探索的分析
-
51
データジャーナリズムと歴史 — 語るための計量
データストーリーテリング、根拠としての可視化、一般向け発信、量的証拠の物語化
-
52
再現可能な研究 — 分析の透明化
再現性、コードとデータの公開、ノートブック、バージョン管理、検証可能な計量史学
-
53
研究データ管理 — データのライフサイクル
データ管理計画、メタデータ、保存、共有、FAIR原則、リポジトリ、長期保存性
-
54
オープンデータと歴史 — 公開と再利用
オープンデータ、ライセンス、CC、データの再利用、市民科学、データ公開の意義と課題
-
55
著作権とテキストマイニング — 法的枠組み
著作権法、情報解析目的の利用、権利制限規定、非享受利用、コーパス公開の権利処理
-
56
プログラミング環境 — 分析のためのツール
Python・R、Jupyter、pandas、テキスト処理ライブラリ、環境構築、コーディングの基礎
-
57
Pythonによるテキスト分析 — 実装の基礎
NLTK・spaCy・gensim、テキスト処理、形態素解析連携、分析パイプライン、可視化ライブラリ
-
58
Rによる計量分析 — 統計と可視化
tidyverse、tm・quanteda、統計分析、ggplot2、テキストマイニング、再現可能なレポート
-
59
既存ツールの活用 — GUIツールとサービス
Voyant Tools、KH Coder、AntConc、MALLET、ノーコード分析、ツール選択と限界
-
60
KH Coderと計量テキスト分析 — 定番の日本語ツール
共起ネットワーク、対応分析、抽出語、コーディング、日本語テキストの計量分析、社会調査的応用
-
61
コーパス言語学の手法 — 言語データの分析法
コーパス頻度、コロケーション、キーワード分析、参照コーパス、歴史コーパスの言語分析
-
62
歴史的日本語処理 — 古文・近世文への対応
古文用形態素解析辞書、変体仮名、候文、歴史的仮名遣い、時代別言語資源、通時コーパス
-
63
多言語史料の処理 — 言語横断の計量
多言語コーパス、言語判定、機械翻訳、言語横断検索、多言語NLP、比較のための標準化
-
64
漢文・古典中国語の処理 — 東アジア古典の計量
漢文の分かち書き、句読、訓点、古典中国語コーパス、東アジア古典籍の計量分析
-
65
メタデータ設計 — 分析基盤の情報構造
メタデータスキーマ、書誌情報、時空間情報、構造化、標準準拠、分析可能なデータ設計
-
66
TEIとテキスト構造化 — 人文学の標準
Text Encoding Initiative、XMLマークアップ、テキスト構造・異文・注釈、構造化テキストの分析
-
67
データベース設計 — 史料データの管理
リレーショナル設計、正規化、時空間データ、全文検索、大規模史料データベースの構築
-
68
全文検索システム — 大量テキストの検索
転置インデックス、Elasticsearch、あいまい検索、ファセット、歴史コーパスの検索基盤
-
69
大規模データ処理 — スケールへの対応
分散処理、バッチ処理、メモリ管理、大規模コーパスの効率的処理、クラウド計算
-
70
パターン発見と仮説生成 — 探索的分析
探索的データ分析、異常検出、パターンマイニング、仮説の発見、精読による検証への橋渡し
-
71
因果推論の難しさ — 相関から因果へ
相関と因果、交絡、自然実験、操作変数、歴史データでの因果推論の限界と慎重さ
-
72
解釈の妥当性 — 数字を歴史に翻訳する
計量結果の歴史的解釈、過剰解釈の危険、文脈への埋め戻し、量と質の統合、解釈の検証
-
73
偏りと誤りの検証 — 結果を疑う
OCR誤りの影響、前処理の偏り、モデルのバイアス、結果の頑健性検証、感度分析
-
74
量的手法の限界 — 何ができて何ができないか
計量の適用限界、意味の捨象、文脈喪失、ブラックボックス、精読との相補性の再確認
-
75
質的分析との統合 — 混合研究法
量と質の混合、計量による発見の精読、精読による量的仮説、往還する研究デザイン
-
76
研究デザイン — ビッグデータ史学の設計
問いとデータの対応、手法選択、コーパス設計、検証計画、成果公開、プロジェクトの全体設計
-
77
問いの立て方 — 計量に適した問題設定
計量可能な問い、仮説の操作化、データで答えられる問い、探索と検証、問いの更新
-
78
学際協働 — 歴史家と情報科学者の協力
分野横断チーム、共通言語、役割分担、ツール開発と研究、協働のマネジメント
-
79
デジタルヒストリーの制度化 — 教育と基盤
デジタルヒューマニティーズ教育、研究基盤、人材養成、評価とキャリア、コミュニティ形成
-
80
カルチャロミクス — 大規模文化トレンド分析
Google Books Ngram、文化の計量、語彙の盛衰、集合的記憶と忘却、大規模時系列の可能性と批判
-
81
新聞・雑誌の大量分析 — 定期刊行物マイニング
デジタル新聞アーカイブ、記事分類、論調分析、時系列トピック、大量報道からの歴史像
-
82
議会・行政記録の分析 — 公的テキストの計量
議事録マイニング、発言分析、政策言説、法令テキスト、政治過程の計量的分析
-
83
書簡・日記の計量 — エゴドキュメントの大量分析
書簡ネットワーク、日記コーパス、感情・話題の分析、個人記録の集合的分析、私的テキストの計量
-
84
裁判・行政簿冊の分析 — 大量事例の統計
訴訟記録、戸籍・宗門改、大量の定型記録、事例の集計、社会史的計量、記録の系統的分析
-
85
経済史料の計量 — 帳簿・統計の分析
商業帳簿、価格系列、貿易統計、計量経済史、大量経済データの時系列・回帰分析
-
86
学術知の計量 — 論文・書誌の分析
書誌計量、引用分析、学問の発展の可視化、知識生産の歴史、サイエントメトリクスの歴史応用
-
87
視覚資料の大量分析 — 画像コレクションの計量
画像アーカイブ、色・構図の計量、画像類似、絵画・写真の大規模分析、ビジュアルの遠読
-
88
音声・動画史料の分析 — マルチメディアの計量
音声認識、動画解析、口述記録の書き起こし、放送アーカイブ、マルチモーダルな歴史分析
-
89
ウェブアーカイブの分析 — 現代史のビッグデータ
ウェブアーカイブ、SNSデータ、大量デジタル記録、現代史の計量、ボーンデジタル史料の分析
-
90
データ倫理 — 計量史学の責任
個人情報、プライバシー、集団への配慮、アルゴリズムのバイアス、結果の悪用防止、研究倫理
-
91
結果の伝達 — 計量成果の論文化
計量結果の記述、可視化の提示、手法の説明、解釈の位置づけ、専門誌と一般への発信
-
92
批判的データリテラシー — データを疑う目
データの由来と偏り、計量の前提、可視化の誘導、数字の政治性、批判的にデータを読む力
-
93
類似度と距離 — テキスト間の近さの測定
コサイン類似度、ジャッカード係数、編集距離、ベクトル空間モデル、文書間距離、類似文書の探索
-
94
バーストと変化点 — 急変を捉える
バースト検出、変化点分析、語の急増、話題の突発、時系列の構造変化、事件と言説の対応
-
95
地理と計量の統合 — テキストの空間化
地名抽出と地図化、ジオパージング、空間的言説分析、テキストマイニングとGISの連携
-
96
アノテーションとタグ付け — 学習データの作成
アノテーションガイドライン、人手タグ付け、アノテーター間一致、教師データの品質、コーディング設計
-
97
計量史学の歴史 — 方法の系譜
クリオメトリクス、新経済史、計量歴史学の興隆と批判、デジタル転回、計量的手法の受容と変遷
-
98
ビッグデータ史学の統合設計 — 計量と解釈の往還
問い・コーパス・手法・検証・解釈の統合、量的発見と歴史的文脈の接続、混合研究法の総合設計
-
99
ビッグデータ史学設計(テキストマイニング) — 退避・古典資料archive
旧版教材、歴史的論文、廃止手法のアーカイブなど、現行分類から退避した資料の保管区分