空間の単位は固定された容器ではない。旧国・旧郡、近世村、藩、市区町村は、いずれも合従・分割・廃置を繰り返してきた。通時的な分析をするには、この変化をデータとして表し、時代をまたいで同じものを同じと言える仕組みが要る。以下では、日本の江戸・近世から近代にかけて整備されてきたデータセットを手がかりに、何が問題になるかを整理する。

異なる時点の単位を一つのエンティティに束ねる

境界が動く単位をデータにするとき、最初の問いは、異なる時点に現れる単位をどう結びつけるかである。歴史的行政区域データセットは、国土数値情報などを統合し、1920年以降の市区町村に網羅的にIDを付与した試みで、合計16,729件を識別している [UC-013 §歴史的行政区域データセット——市区町村IDの付与]。八王子市には「13201A1968」というIDが与えられ、合併で範囲が広がっても概念としての八王子市を一つのエンティティに統合している [UC-013 §歴史的行政区域データセット——市区町村IDの付与]。資料に「八王子市」が現れたとき、そのIDに結びつけたうえで、資料の年次から境界の範囲を確認できる [UC-033 §地名のデータセット:行政区域から近世村へ]。

名称が同じなら同じものとみなす、という処理は自明ではない。「東京」が指す対象は、東京府東京市の15区、35区、東京都特別区部(23区)と変遷しており、これらを「同じ東京」とみなすかは立場によって分かれる [UC-013 §歴史的行政区域データセット——市区町村IDの付与]。IDが記録するのは答えではなく、どの基準でまとめたかという判断である。

遡及の範囲には限りがある。網羅的な対応が取れているのは1920年以降で、1919年から1889年(市制及び町村制の成立年)への遡及、さらに明治から江戸への遡及は課題として残っている。1889〜2006年については行政界変遷データベースがあるが、誤りが多く、部分的な利用にとどまるという [UC-013 §歴史的行政区域データセット——市区町村IDの付与]。

近世村という単位

江戸時代の村は、近代の行政区域よりさらに扱いにくい。境界が公式に画定されておらず、名称には表記揺れがあり、資料によって村の粒度が違う。

幕末期近世村領域データセットは、幕末期の近世村66,581件を収録し、各村の領域を現代の農業集落境界データで近似している [UC-013 §江戸時代の村のデータセット——統合の試みと課題]。現代の農業集落と江戸時代の村にそれなりの連続性があるという前提に立った代用であって、両者は同じものではない [UC-033 §地名のデータセット:行政区域から近世村へ]。この領域データと『日本歴史地名大系』地名項目データセット(80,502件)を名称の一致で照合した江戸近世村統合データセットでは、約56,000件が同じ村を指すと判断できた。他方、粒度の相違や表記揺れのために対応づけられない例が相当数残った [UC-013 §江戸時代の村のデータセット——統合の試みと課題]。表記揺れの一因にはOCR誤りもあり、どれが正しいかを一件ずつ確かめるのは大変な作業になると述べられている [UC-013 §江戸時代の村のデータセット——統合の試みと課題]。

もう一つの記事でも、一方では1村が他方では東西2村に分かれて粒度が食い違う場合や、村名の表記が異なって対応づけられない場合が見つかっており、丁寧に進めるにはかなりの時間がかかると見込まれている [UC-012 §江戸近世村データセット]。

藩という単位に固有の困難

藩は、行政区域や村よりさらに定義しにくい。江戸時代に幕府が藩を公式にリスト化したことはなく、「藩」という語自体が明治以降に使われるようになったものである [UC-013 §藩IDデータセット——識別子の付与と研究動向の可視化]。総数の確定も藩の定義も歴史研究の問題に属するため、データセットの側で厳密に扱うことはできない [UC-012 §藩IDデータセット]。

藩IDデータセットは、『藩史大事典』など複数の事典を比較して統合・分離を検討し、寛文4年(1664)から明治4年(1871)に存在した藩として408藩にIDを付与した [UC-013 §藩IDデータセット——識別子の付与と研究動向の可視化]。ただしこれも唯一の正解ではなく、本研究の判断であるとされている [UC-012 §藩IDデータセット]。

呼称にも公式の基準がない。地名で呼ぶか家名で呼ぶかという違いがあり(仙台藩と伊達藩)、出羽・伊予・備中に同名の松山藩が三つある場合もある [UC-013 §藩IDデータセット——識別子の付与と研究動向の可視化]。代表的な呼称はJ-STAGEの論文での使われ方やWikipediaの用例といった現代の利用実態も参照して決めており [UC-012 §藩IDデータセット]、データを設計する側の判断が避けがたく入り込む。

空間的な表現も単純ではない。藩の領域が居城の周囲にまとまるとは限らず、加賀藩・熊本藩・尾張藩などでは領分が複数の地域に分かれ、飛び地を持つ例が多い [UC-013 §藩IDデータセット——識別子の付与と研究動向の可視化]。村は基本的に一つの領主に属するが、複数の領主を持つ村もあり、村と藩は多対多の関係にある [UC-010 §藩IDデータセットと村・藩の統合的な可視化]。藩の代表点は居城・陣屋の位置で与えるが、小さな藩では所在が判然としないものがあり、精査が続いている [UC-012 §藩IDデータセット]。位置を一点に決められない場合は、Uber H3インデックスの六角形で範囲を指定し、ID自体に曖昧さのレベルを含める工夫が導入されている [UC-033 §地名のデータセット:藩・街道・宿場とGeoLOD]。

さらに、藩と大名家は一対一ではない。江戸時代は藩ではなく大名家が主であり、大名家が移動する場合もある。そのため藩IDとは別に大名家IDが必要で、当主交代などのイベントを扱うにはより複雑なID体系が求められる [UC-012 §藩IDデータセット]。

時代をまたいで同じ場所を指すこと

旧国・旧郡の境界データでも、時点の選び方が問題になる。明治期と江戸期では国・郡の分け方が異なるため、既存データをそのまま使えず、旧国・旧郡境界データセットの構築では江戸・明治の実情に合わせてIDを付与し直した [UC-013 §既存データセットの活用と過去データの課題]。ある一時点のために整えられたデータを通時的に使おうとすると、どの時点の区分を基準にするかを決めなければならない。

街道にも同じ難しさがある。江戸主要街道データセットと江戸宿場データセットに番号を付与する作業が進められているが、街道には時期による移設や経路の違いがあり、複数の経路が想定されうる [UC-012 §江戸期地理データセット]。IDを与えつつ、説や時期に応じて複数の経路を割り当てられる柔軟な枠組みが望ましい。ナンバリングにも公式の定義がなく呼称や経路がぶれるため、できるだけ柔軟に対応したいとされている [UC-012 §江戸期地理データセット]。

既存の通時的データセットが再利用しにくい理由

既存のデータ資産を通時的に生かそうとすると、構造的な困難が重なる。報告されているのは次の四点である [UC-013 §既存データセットの活用と過去データの課題]。

行政界変遷データベースは精度の問題でそのまま使えず、部分的な利用にとどめざるを得ない例である [UC-013 §歴史的空間情報基盤の課題と今後の展望]。同じ記事には、別プロジェクトで埋もれていた旧東京市15区住所データセットを、利用許諾を得て再整備した例も報告されており [UC-013 §歴史的空間情報基盤の課題と今後の展望]、使えるかどうかは個々のデータの来歴と権利関係にも左右される。