規模を変えることは問いの種類を変える。一点を深く読む精読では届かない問いに、大量の資料を集めて集約する遠読が答えることがあり、その逆もある。本節は個々の手法には立ち入らず、規模を変える見方が何をもたらし、何を手放すかに絞って述べる。

集約して見えてくるもの

絵本や絵巻のデジタル画像から顔の部分だけを切り抜き、「山伏」といったメタデータを付けて集めた顔貌コレクション(顔コレ)は、この見方の具体例である。網羅的なデータセットとして並べることで顔の様式を比較でき、一点ずつ見ていては気づかない傾向が、規模を上げることで見えてくる [UC-040 §顔貌コレクションとデータ駆動型人文学]。個々の検出や比較の手法は「特徴抽出と様式分析」を参照。

歴史記録からのデータ収集も同じ論理に立つ。日記の気象記録、被害記録の地震・噴火情報、感染症の記録、米相場、村ごとの人口は、一点を読めば断片にすぎない。大量に集めて機械可読データにすると、分布や変化として見えてくる。この立場を指す語が「歴史ビッグデータ」である [UC-011 §2. 「歴史ビッグデータ」という課題]。Time Machine Europe は「Big Data of the Past(過去のビッグデータ)」を掲げ、Living with Machines は大量のデジタル化資料から産業革命の影響を分析しようとしている。いずれもこの系譜にある [UC-011 §2. 「歴史ビッグデータ」という課題]。

写真を通時的に並べる場合も、問いの構造は共通する。同一構図の写真を継続的に集めて並べ、画素レベルで比較すると、人が気づかない微細な変化が浮かび上がることがある [UC-016 §景観を「読む」ための新しい技術]。

集約が消してしまうもの

規模を上げることには代償がある。集約は共通する様式や分布を取り出すが、資料に固有の文脈、つまり誰が、どこで、どのような意図で書いたかは、集約の過程で薄れやすい。

写真の例はこの点を具体的に示す。景観を「読む」には、その場所についての知識が要る。場所をよく知っていれば何をどこから撮ればよいかを判断できるが、知らなければ画素の変化を見ても理解に時間がかかる [UC-016 §景観を「読む」ための新しい技術]。集約から得られる情報と、文脈の理解があって初めて解釈できる情報とは、種類が違う。

大量の資料を同じ基準で扱うために、個々の表現を犠牲にすることもある。古地図の位置合わせでは、幾何補正によって多くの点の位置が合う一方、形が歪んで地図上の文字が読めなくなる [UC-011 §6. 古地図の位置合わせ手法とソフトウェア]。全体の精度を上げるために個別の表現を手放すという同じ得失は、遠読一般に当てはまる。個別の手法は「地図資料の処理」を参照。

遠読と精読は対立しない

遠読には固有の強みがある。データの共有やエビデンスに基づく検証という文化を人文学に導入することも、データ駆動型人文学の課題とされる [UC-040 §顔貌コレクションとデータ駆動型人文学]。照合可能な根拠を示せることは、一点の読解にはない利点である。北本朝展氏が、単にデジタルデータを使うことと、デジタルの利点を活かす方向へ研究手法そのものを進化させることとのあいだに「大きな違い」があると述べているのも、この点にかかわる [UC-040 §顔貌コレクションとデータ駆動型人文学]。

ただし、一度作ったデータセットが多目的に使えるという点は慎重に読む必要がある。顔コレは美術史研究、顔認識研究、GAN による生成研究など複数の用途に使える [UC-040 §顔貌コレクションとデータ駆動型人文学]。しかし、データセットを作る際の分類や切り取りの選択が、後から問える問いの範囲をすでに規定している。この点は「データモデリングと構造化」を参照。

都市景観の分析を「digitally-enabled criticism」と呼ぶ立場は、デジタルによる規模的な処理と批判的な読解を切り離さず、技術を批評的な実践の道具として位置づける [UC-016 §景観を「読む」ための新しい技術]。二つの読み方の関係は、どちらを先に行うかという順序の問題ではない。規模を変えるたびに問いが変わることを自覚して使い分けることが、その関係になる。