W 12.45

ビッグデータ史学設計(テキストマイニング)

100 区画
  1. 00

    ビッグデータ史学設計(テキストマイニング) — 概要

    大量の歴史テキストを計算的に扱うビッグデータ史学の設計、コーパス構築・テキストマイニング・統計分析・機械学習による歴史研究の全体を見渡す入門ガイド

  2. 01

    ビッグデータ史学とは — 計算による歴史研究

    デジタルヒストリー、遠読、大量テキストの計算分析、カルチャロミクス、量的転回、方法と射程

  3. 02

    遠読と精読 — スケールを変える読解

    モレッティの遠読(distant reading)、マクロ分析、精読との補完、パターン発見、仮説生成と検証

  4. 03

    歴史コーパスの構築 — 分析対象を作る

    コーパスデザイン、収録範囲、代表性、サンプリング、メタデータ、著作権、バランス、時系列の連続性

  5. 04

    テキストのデジタル化 — 史料を機械可読に

    スキャンとOCR、翻刻、構造化、文字コード、旧字体・異体字、デジタル化の誤りと品質管理

  6. 05

    OCRとHTR — 活字と手書きの文字認識

    光学文字認識、手書き文字認識(HTR)、Transkribus、くずし字認識、学習モデル、認識精度の評価

  7. 06

    くずし字認識 — 日本の古典籍を読む

    くずし字OCR、KuroNet、字形の多様性、変体仮名、AIによる翻刻、翻刻支援と人手校正の協働

  8. 07

    テキストの正規化 — 表記ゆれを整える

    正規化、旧字新字変換、異表記統一、句読点補完、トークン化前処理、歴史的表記の扱い

  9. 08

    形態素解析 — 単語への分割と品詞付与

    トークン化、形態素解析器、古文用辞書、品詞タグ付け、未知語処理、歴史的日本語への対応

  10. 09

    分かち書きと言語処理 — 前処理の基礎

    分かち書き、ストップワード、ステミング・レンマ化、n-gram、前処理パイプライン、言語依存性

  11. 10

    単語頻度分析 — もっとも基本的な計量

    頻度表、相対頻度、ジップの法則、特徴語抽出、時系列頻度、頻度変化からの読み取り

  12. 11

    共起分析 — 語と語のつながり

    共起頻度、コロケーション、共起ネットワーク、相互情報量、文脈語、概念の関連構造の可視化

  13. 12

    KWICとコンコーダンス — 文脈の中の語

    キーワード・イン・コンテキスト、用例検索、コンコーダンサ、語の用法分析、精読への橋渡し

  14. 13

    特徴語抽出 — 際立つ語を見つける

    TF-IDF、対数尤度比、カイ二乗、特徴度、コーパス間比較、時代・著者を特徴づける語

  15. 14

    ネットワーク分析の基礎 — 関係を測る

    ノードとエッジ、次数・中心性、ネットワーク密度、可視化、歴史的関係データへの応用

  16. 15

    人的ネットワーク分析 — 人と人のつながり

    書簡ネットワーク、共著・師弟、媒介中心性、コミュニティ検出、歴史的社会関係の構造分析

  17. 16

    引用・参照ネットワーク — 知の伝播

    引用ネットワーク、テキスト間参照、影響関係、知識伝播の可視化、テキスト再利用の追跡

  18. 17

    テキスト再利用検出 — 借用と引用の発見

    テキストリユース、n-gram一致、類似文検出、盗用・引用・改変、文献間の依存関係の解明

  19. 18

    主題モデル(LDA) — 潜在的主題の抽出

    LDA、潜在ディリクレ配分、主題と文書の分布、ハイパーパラメータ、抽出された主題の解釈と命名

  20. 19

    主題の時系列分析 — 話題の盛衰を追う

    動的主題モデル、主題割合の推移、話題の出現と衰退、時代と主題の対応、言説の変遷の計量

  21. 20

    文書分類 — テキストの自動仕分け

    教師あり分類、特徴量設計、ナイーブベイズ・SVM、ジャンル・時代・著者分類、評価指標

  22. 21

    クラスタリング — テキストの自動グループ化

    教師なし学習、k-means、階層クラスタリング、文書類似度、クラスタの解釈、探索的分析

  23. 22

    感情分析 — テキストの情動を測る

    センチメント分析、感情辞書、極性、歴史テキストへの適用の難しさ、時代差と語義変化の影響

  24. 23

    著者推定 — 文体から書き手を探る

    スタイロメトリー、機能語頻度、デルタ法、著者判別、真贋・帰属問題、共著・代作の検出

  25. 24

    文体計量 — 書きぶりを数える

    文長・語彙多様性、タイプトークン比、機能語分布、文体指標、時代・ジャンルの文体変化

  26. 25

    語義の変化 — 意味の歴史を追う

    通時的語義変化、意味のドリフト、通時的単語埋め込み、語の用法の変遷、概念史との接続

  27. 26

    単語埋め込み — 語をベクトルにする

    word2vec、分散表現、意味の類似、ベクトル演算、歴史コーパスでの学習、意味空間の可視化

  28. 27

    通時的埋め込み — 意味変化の計量

    時代別埋め込み、意味変化の定量化、埋め込みの整列、語義ドリフトの検出、概念の移動の追跡

  29. 28

    固有表現抽出 — 人名・地名・日付の自動抽出

    NER、固有表現認識、人名・地名・組織・年月日、歴史テキストへの適用、抽出結果の構造化

  30. 29

    エンティティリンキング — 実体への名寄せ

    同名異人の判別、典拠への紐付け、地名解決、知識ベース連携、名寄せの曖昧性処理

  31. 30

    関係抽出 — テキストから関係を取り出す

    人物間関係、出来事と参加者、関係抽出、イベント抽出、構造化知識の自動構築

  32. 31

    イベント抽出 — 出来事の自動同定

    出来事の抽出、時間・場所・参与者、年表の自動生成、歴史的事件のデータ化、時系列構築

  33. 32

    時間表現の処理 — 日付と期間の正規化

    時間表現抽出、和暦・元号の変換、相対時間、TimeML、時間軸へのマッピング、暦の換算

  34. 33

    知識グラフ構築 — 歴史知識のネットワーク化

    エンティティと関係のグラフ、RDF、知識ベース、人物・出来事・場所の連結、推論と検索

  35. 34

    構造化データ化 — 非構造テキストの表化

    テキストからテーブルへ、属性抽出、データベース化、プロソポグラフィデータ、集計可能化

  36. 35

    プロソポグラフィと計量 — 集団経歴の分析

    経歴データベース、集団的属性分析、エリートの統計、職歴パターン、大量伝記データの解析

  37. 36

    歴史統計の基礎 — 数量史料の分析

    記述統計、時系列、指数、実質化、統計的検定、歴史統計の作成と批判的利用

  38. 37

    時系列分析 — 歴史データの時間変動

    トレンドと周期、移動平均、変化点検出、系列相関、物価・人口・気候の時系列分析

  39. 38

    回帰分析 — 要因と結果の推定

    線形回帰、重回帰、説明変数、係数の解釈、歴史データの回帰、因果推論の限界

  40. 39

    多変量解析 — 複数変数の同時分析

    主成分分析、対応分析、因子分析、次元削減、多変量パターン、考古・歴史データへの応用

  41. 40

    対応分析 — カテゴリの布置

    コレスポンデンス分析、行と列の同時布置、型式と遺跡、著者と語彙、質的データの可視化

  42. 41

    ベイズ統計と歴史 — 不確実性の推論

    ベイズ推論、事前分布、事後分布、少数データへの対応、年代・人口推定、不確実性の定量化

  43. 42

    欠損と偏りへの対処 — 不完全データの扱い

    史料の残存バイアス、生存バイアス、欠損データ、補完、代表性の評価、偏りを踏まえた解釈

  44. 43

    サンプリングと代表性 — 一部から全体を推す

    標本抽出、母集団の推定、コーパスの偏り、抽出設計、残存史料の代表性問題

  45. 44

    機械学習の基礎 — 歴史研究への導入

    教師あり・教師なし、訓練とテスト、過学習、特徴量、モデル評価、歴史データでの機械学習

  46. 45

    深層学習と歴史テキスト — ニューラルモデル

    ニューラルネットワーク、RNN・LSTM、系列処理、事前学習、歴史テキストへの適用と課題

  47. 46

    大規模言語モデルと史学 — LLMの活用

    大規模言語モデル、要約・分類・抽出、翻刻・現代語訳支援、幻覚のリスク、検証の必要

  48. 47

    画像認識と歴史資料 — ビジュアルの計量

    画像分類、物体検出、図像の自動分析、絵画・地図・写真の計量、視覚的大量分析

  49. 48

    手書き資料の一括処理 — 大量文書の機械読取

    HTRパイプライン、レイアウト解析、行検出、大量古文書の翻刻、人手校正との組合せ

  50. 49

    データ可視化 — 分析結果を見せる

    グラフ・チャート、ネットワーク図、ヒートマップ、時系列可視化、探索的可視化、伝達の設計

  51. 50

    インタラクティブ可視化 — 探索できる図

    ダッシュボード、ズーム・フィルタ、動的グラフ、ウェブ可視化、利用者による探索的分析

  52. 51

    データジャーナリズムと歴史 — 語るための計量

    データストーリーテリング、根拠としての可視化、一般向け発信、量的証拠の物語化

  53. 52

    再現可能な研究 — 分析の透明化

    再現性、コードとデータの公開、ノートブック、バージョン管理、検証可能な計量史学

  54. 53

    研究データ管理 — データのライフサイクル

    データ管理計画、メタデータ、保存、共有、FAIR原則、リポジトリ、長期保存性

  55. 54

    オープンデータと歴史 — 公開と再利用

    オープンデータ、ライセンス、CC、データの再利用、市民科学、データ公開の意義と課題

  56. 55

    著作権とテキストマイニング — 法的枠組み

    著作権法、情報解析目的の利用、権利制限規定、非享受利用、コーパス公開の権利処理

  57. 56

    プログラミング環境 — 分析のためのツール

    Python・R、Jupyter、pandas、テキスト処理ライブラリ、環境構築、コーディングの基礎

  58. 57

    Pythonによるテキスト分析 — 実装の基礎

    NLTK・spaCy・gensim、テキスト処理、形態素解析連携、分析パイプライン、可視化ライブラリ

  59. 58

    Rによる計量分析 — 統計と可視化

    tidyverse、tm・quanteda、統計分析、ggplot2、テキストマイニング、再現可能なレポート

  60. 59

    既存ツールの活用 — GUIツールとサービス

    Voyant Tools、KH Coder、AntConc、MALLET、ノーコード分析、ツール選択と限界

  61. 60

    KH Coderと計量テキスト分析 — 定番の日本語ツール

    共起ネットワーク、対応分析、抽出語、コーディング、日本語テキストの計量分析、社会調査的応用

  62. 61

    コーパス言語学の手法 — 言語データの分析法

    コーパス頻度、コロケーション、キーワード分析、参照コーパス、歴史コーパスの言語分析

  63. 62

    歴史的日本語処理 — 古文・近世文への対応

    古文用形態素解析辞書、変体仮名、候文、歴史的仮名遣い、時代別言語資源、通時コーパス

  64. 63

    多言語史料の処理 — 言語横断の計量

    多言語コーパス、言語判定、機械翻訳、言語横断検索、多言語NLP、比較のための標準化

  65. 64

    漢文・古典中国語の処理 — 東アジア古典の計量

    漢文の分かち書き、句読、訓点、古典中国語コーパス、東アジア古典籍の計量分析

  66. 65

    メタデータ設計 — 分析基盤の情報構造

    メタデータスキーマ、書誌情報、時空間情報、構造化、標準準拠、分析可能なデータ設計

  67. 66

    TEIとテキスト構造化 — 人文学の標準

    Text Encoding Initiative、XMLマークアップ、テキスト構造・異文・注釈、構造化テキストの分析

  68. 67

    データベース設計 — 史料データの管理

    リレーショナル設計、正規化、時空間データ、全文検索、大規模史料データベースの構築

  69. 68

    全文検索システム — 大量テキストの検索

    転置インデックス、Elasticsearch、あいまい検索、ファセット、歴史コーパスの検索基盤

  70. 69

    大規模データ処理 — スケールへの対応

    分散処理、バッチ処理、メモリ管理、大規模コーパスの効率的処理、クラウド計算

  71. 70

    パターン発見と仮説生成 — 探索的分析

    探索的データ分析、異常検出、パターンマイニング、仮説の発見、精読による検証への橋渡し

  72. 71

    因果推論の難しさ — 相関から因果へ

    相関と因果、交絡、自然実験、操作変数、歴史データでの因果推論の限界と慎重さ

  73. 72

    解釈の妥当性 — 数字を歴史に翻訳する

    計量結果の歴史的解釈、過剰解釈の危険、文脈への埋め戻し、量と質の統合、解釈の検証

  74. 73

    偏りと誤りの検証 — 結果を疑う

    OCR誤りの影響、前処理の偏り、モデルのバイアス、結果の頑健性検証、感度分析

  75. 74

    量的手法の限界 — 何ができて何ができないか

    計量の適用限界、意味の捨象、文脈喪失、ブラックボックス、精読との相補性の再確認

  76. 75

    質的分析との統合 — 混合研究法

    量と質の混合、計量による発見の精読、精読による量的仮説、往還する研究デザイン

  77. 76

    研究デザイン — ビッグデータ史学の設計

    問いとデータの対応、手法選択、コーパス設計、検証計画、成果公開、プロジェクトの全体設計

  78. 77

    問いの立て方 — 計量に適した問題設定

    計量可能な問い、仮説の操作化、データで答えられる問い、探索と検証、問いの更新

  79. 78

    学際協働 — 歴史家と情報科学者の協力

    分野横断チーム、共通言語、役割分担、ツール開発と研究、協働のマネジメント

  80. 79

    デジタルヒストリーの制度化 — 教育と基盤

    デジタルヒューマニティーズ教育、研究基盤、人材養成、評価とキャリア、コミュニティ形成

  81. 80

    カルチャロミクス — 大規模文化トレンド分析

    Google Books Ngram、文化の計量、語彙の盛衰、集合的記憶と忘却、大規模時系列の可能性と批判

  82. 81

    新聞・雑誌の大量分析 — 定期刊行物マイニング

    デジタル新聞アーカイブ、記事分類、論調分析、時系列トピック、大量報道からの歴史像

  83. 82

    議会・行政記録の分析 — 公的テキストの計量

    議事録マイニング、発言分析、政策言説、法令テキスト、政治過程の計量的分析

  84. 83

    書簡・日記の計量 — エゴドキュメントの大量分析

    書簡ネットワーク、日記コーパス、感情・話題の分析、個人記録の集合的分析、私的テキストの計量

  85. 84

    裁判・行政簿冊の分析 — 大量事例の統計

    訴訟記録、戸籍・宗門改、大量の定型記録、事例の集計、社会史的計量、記録の系統的分析

  86. 85

    経済史料の計量 — 帳簿・統計の分析

    商業帳簿、価格系列、貿易統計、計量経済史、大量経済データの時系列・回帰分析

  87. 86

    学術知の計量 — 論文・書誌の分析

    書誌計量、引用分析、学問の発展の可視化、知識生産の歴史、サイエントメトリクスの歴史応用

  88. 87

    視覚資料の大量分析 — 画像コレクションの計量

    画像アーカイブ、色・構図の計量、画像類似、絵画・写真の大規模分析、ビジュアルの遠読

  89. 88

    音声・動画史料の分析 — マルチメディアの計量

    音声認識、動画解析、口述記録の書き起こし、放送アーカイブ、マルチモーダルな歴史分析

  90. 89

    ウェブアーカイブの分析 — 現代史のビッグデータ

    ウェブアーカイブ、SNSデータ、大量デジタル記録、現代史の計量、ボーンデジタル史料の分析

  91. 90

    データ倫理 — 計量史学の責任

    個人情報、プライバシー、集団への配慮、アルゴリズムのバイアス、結果の悪用防止、研究倫理

  92. 91

    結果の伝達 — 計量成果の論文化

    計量結果の記述、可視化の提示、手法の説明、解釈の位置づけ、専門誌と一般への発信

  93. 92

    批判的データリテラシー — データを疑う目

    データの由来と偏り、計量の前提、可視化の誘導、数字の政治性、批判的にデータを読む力

  94. 93

    類似度と距離 — テキスト間の近さの測定

    コサイン類似度、ジャッカード係数、編集距離、ベクトル空間モデル、文書間距離、類似文書の探索

  95. 94

    バーストと変化点 — 急変を捉える

    バースト検出、変化点分析、語の急増、話題の突発、時系列の構造変化、事件と言説の対応

  96. 95

    地理と計量の統合 — テキストの空間化

    地名抽出と地図化、ジオパージング、空間的言説分析、テキストマイニングとGISの連携

  97. 96

    アノテーションとタグ付け — 学習データの作成

    アノテーションガイドライン、人手タグ付け、アノテーター間一致、教師データの品質、コーディング設計

  98. 97

    計量史学の歴史 — 方法の系譜

    クリオメトリクス、新経済史、計量歴史学の興隆と批判、デジタル転回、計量的手法の受容と変遷

  99. 98

    ビッグデータ史学の統合設計 — 計量と解釈の往還

    問い・コーパス・手法・検証・解釈の統合、量的発見と歴史的文脈の接続、混合研究法の総合設計

  100. 99

    ビッグデータ史学設計(テキストマイニング) — 退避・古典資料archive

    旧版教材、歴史的論文、廃止手法のアーカイブなど、現行分類から退避した資料の保管区分