テキストに散在する地名・人名・年代といった実体を取り出し、辞書や知識グラフに接続する作業は、テキストを他のデータにつなぐ独立した工程である。統計的な傾向を測る分析とは異なり、この工程が問うのは「どの実体が、どの外部データとつながるか」である。

「取り出す」と「辞書につなぐ」の二段階

テキスト中に出現する地名と住所を自動的に抽出し、辞書中のエントリにリンクするソフトウェアとして GeoNLP がある。住所解析のエンジンとして jageocoder が組み込まれており、地名辞書を拡張すれば適用範囲を広げられる設計になっている [UC-031 §現代の住所を対象とした応用事例]。

この二段階は実際には分離しにくい。取り出した文字列をどの辞書エントリに対応させるかは、表記の問題を含むからである。省略された住所や異体字といった、現実のデータに頻出するズレに対処するために、実データで集めた表記揺れを辞書に一件ずつ登録して対応づける方法が取られている [UC-031 §旧東京市15区住所データセットの構築]。その作り方と、辞書を拡張するか元データを修正するかの判断は「地名という接点」を参照されたい。

変換できた範囲と変換できなかった範囲

テキストから取り出した実体が外部データに接続できる保証はなく、接続できた範囲とできなかった範囲を区別して扱う必要がある。

『日本歴史地名大系』地名項目データセットの位置推定では、平成の大合併以前の住所が含まれるため、そのまま現代のジオコーダーに入れても位置を特定できない。そこで、大合併以前の住所に対応する現代住所の候補を jageocoder で探してからジオコーディングし、推定緯度経度として地図にマッピングする手順が取られた。自動化できる部分がある一方で、手動で対応しなければならない部分が多く残るという評価が報告されている [UC-031 §現代の住所を対象とした応用事例]。

住所の書かれ方が断片的な場合もある。発電所データの地図化では字レベルの細かい住所が多く、一般的な地図サービスでは検索できないものが含まれていた。「国有林」としか書かれていない場合には、正確な位置の特定に限界が残る [UC-031 §現代の住所を対象とした応用事例]。取り出した実体が位置情報に変換できる割合は、データの性質と辞書の整備状況によって大きく変わる。