はじめに

すでにデジタル化され構造化された西洋古典のテクストを、AIが推論しやすい形へどう作り替えるか。名古屋大学/国立情報学研究所の岩田直也氏は、西洋古典テクスト基盤Humanitextを題材に、保存・配信・推論の三層からなるデータ設計、三つの公開サービス、底本からのTEI/XML整備、運用コストと持続可能性、研究チームとAIエージェントの協働を語りました。

デジタル化とAI-Ready化の違い

AI-Ready化は、翻刻とTEI/XMLによる構造化を進めてきたデジタル化の次の段階として、AIの推論に最適化した形にデータを整えることを指します。

西洋古典の主要なテクストデータは、すでにTEI/XMLとして構造化され、オープンアクセスで入手できます。ただしそれらは、人間が読み、ウェブ上で表示するために整えられたものです。注釈・異読・関連箇所はそこからもAIが読み取れますが、推論のたびに解析・検索して文脈を組み立て直すのでは、答えに取りかかる前に多くのステップとトークンを費やします。

そこで岩田氏は、あらかじめ参照単位にIDを振り、原典どうしや原典と注釈・二次文献の関係をつないでおく方針を採ります。エージェントは張られたリンクをホップするだけで済み、推論の手前の作業をデータ構築の側で済ませられます。

あわせて重視するのが、答えが参照箇所のIDつきで返り、人間が原典に立ち返って検証できることです。もっともらしい答えでも、何に基づく回答なのかが分からなければ使えないためです。

保存・配信・推論の三層アーキテクチャ

Humanitextのテクストデータは保存・配信・推論の三層に分かれ、AIに渡す単位に区切ったチャンクごとの安定したIDが三層を貫き、どの層でも同じ一節を指す参照のアンカーになります。

第1層の保存はTEI/XMLが担い、原典・底本・校訂を記録します。原典の大部分はPerseus Digital Library / Open Greek and Latinなどの正準TEIコーパスに由来し、クローンして再構成・更新しながら用いています。

第2層の配信はチャンキングJSONが担います。TEIをそのままAIに渡すのはタグが多く適切ではありません。そこでJSONでは、参照箇所を特定できるID(CTS URN規格に基づく)と箇所マーカーに絞って最適化しています。

一方、参照のためにチャンク化すると文脈が途切れます。これに対応するのが文脈指向翻訳で、チャンクを単独で訳すと代名詞・省略・照応の指示先が失われるため、直前までのチャンクの訳を文脈として与え、参照の解決にのみ用いて現在のチャンクだけを訳させます。各チャンクは、単独で検索可能でありながら文脈上の指示先を保ちます。チャンク化と文脈保持は本来トレードオフですが、生成時に文脈を参照させることで、ある程度まで両立させています。

第3層の推論は、スタンドオフ注釈のグラフとして検討しています。本文のTEIには手を入れず、その外側で参照関係・異読・注釈を参照単位のIDに結びつけ、テクストの検索(RAG)とグラフ上の関係の探索(GraphRAG)でエージェントがたどれるようにする構想です。この第3層は現在の研究課題であり、実装には至っていません。

三つの公開サービス

配信層の同じデータを読む対話と精読、第1層への入口となる文字認識の三つを公開しています。

典拠を示す対話環境 — Humanitext Antiqua

Humanitext Antiquaは、西洋古典2,338作品・115,145チャンク・447著者を収録し、UIは日英中韓の4言語に対応します。検索は密ベクトルと疎ベクトルのハイブリッド構成で、固有名・術語の一致と意味的な言い換えの双方を拾います。

回答の記述には引用チップが付き、底本と実際に用いた検索クエリを示す典拠パネルへ対応します。何を検索した結果なのかが分からなければ、出典の妥当性を判断できないためです。典拠からHumanitext Readerの同じ箇所を開け、チャンクIDが同じため対応がずれません。

4言語対訳で一文ずつ読む — Humanitext Reader

Humanitext Readerは922作品・94著者を対象に、AIによる文アライメントで対応づけた1,988,222文の対訳を4言語で提供します。日本語・中国語・韓国語で対訳のある古典はごく一部にとどまるため、既存の学術翻訳を置き換えるのではなく、その手前で原典に触れる機会を広げる基盤と位置づけています。

訳・注はAIによる初稿であることを明示し、疑わしい訳や解釈の分かれる箇所は文単位のコメントで議論します。投稿は残り3言語へ自動翻訳され、一つのスレッドに集まります。オープンアクセスのデータには誤りも多く、明らかな誤りは同じパネルから報告でき、キュレーターの確認を経てTEI/XMLと訳文に反映されます。

第1層への入口 — Humanitext OCR

Humanitext OCRはマルチモーダルLLM(Gemini)による文字認識サービスで、資料の特徴と抽出したい内容をプロンプトに書き添えるだけで済み、資料ごとの事前学習やテンプレート設定は不要です。出力は翻刻テキストのほか、原本のページ画像に見えないテキスト層を重ねた検索可能PDFも選べます——見た目は原本のまま、全文検索とコピーができる形です。テキストは行単位で座標とともに取り出すので、原本画像と行テキストが一対一で結びつき、校正ビューアで行ごとの目視校正と招待制の共同校正ができます。

実装上、特に手当てが要ったのは引用保護です。著名な校訂版はモデルの学習データに含まれ、忠実な転写がコピー防止機能(Recitation)に検知されて出力がブロックされることがあります。そこで各行に使い捨てトークン付きの行番号を付けて出力させ、後段で取り除いています。

底本からのTEI/XML整備と、構造化の自動化

既存の正準コーパスに収録がなく、研究基盤に載ってこなかったテクスト群を、底本の画像からTEI/XMLとして新たに整備しました。

古代天文学を扱うPlanetariumでは、9作品・190チャンク・96k語を整備しました。このうちマニリウス『アストロノミカ』(27,413語)ではOCRの精度評価も実施し、脚注・行番号を除外しつつ単語誤り率約0.15%、自動校正後約0.07%と情報処理学会CH研究会報告(2025)で報告しています。ローマ法『学説彙纂』を扱うDigestaでは、9,139断片・21,067節・42法学者分を、底本Mommsen–Krueger 1870から4層のCTS参照体系で構造化し、TEIはCC BY-SA 4.0で公開します。

作業の流れは共通で、Humanitext OCR(当時の前バージョン)で本文のみをテキスト化し、共同研究者・学生が目視で確認しました。巻・章・節の区分などの構造化は、別途スクリプトを書き、目視で確認しながらTEI/XMLに落としています。TEIヘッダのrespStmtには担当者を全員記名し、テクスト準備に携わった人の貢献を記録しています。

現状の工程では、文字の読み取りは自動化されたものの、構造の判断は人間の側に残っています。次の目標は、各行に段落・註のまとまりを示す連番と、本文・校訂註・註解といった役割の区別を付与する拡張です。構造化まで自動化できれば、底本の画像からTEIまでがひと続きになります。

運用コストと持続可能性

運用の実測値は、クエリ数と費用の両面で蓄積しています。2026年8月までにAntiqua(2024年7月開始)で40,937クエリ、青空文庫を対象とする姉妹版Aozora(2025年7月開始)で106,496クエリ、合計147,433クエリが実行されました。Aozoraは公開後1年あまりでAntiquaの2年分を上回りました。一方、認知はまだ限定的で、欧米圏での紹介を進めています。研究者コミュニティにはAI利用への懐疑も根強く、人間とAIの協働関係をどう提示するかが受容の鍵になると岩田氏は考えています。

実測した費用は、対話1クエリあたり約2〜3円です。ホスティング費は、旧版のRender上での運用では月約120ドルを要していましたが、2026年8月に現行版へ移行してからはほぼ無料です。ページの大部分を静的ファイルとして配信網(CDN)に置き、AIを呼び出す部分だけを必要な瞬間に動く小さな関数として実行し、待機し続けるサーバを持たなくしたためです。ただし利用者が増えれば、有料プランへの移行が必要になる見込みです。

恒常的な支出の中心は生成AI(API)の料金であり、利用が拡大すればそれに応じて増えます。年度単位の研究費は構築——たとえばReaderのコーパス拡充には約350万円と試算しています——には適していますが、この費用を賄い続ける枠組みとしては心許ないと岩田氏は述べています。そこでAPI費の一部を利用者に負担してもらう仕組みを検討しています。Readerは無料公開を続ける方針です。

研究チームとAIの協働

Humanitextは、岩田氏と田中一孝氏(桜美林大学)・小川潤氏(東京大学)の3人による共同研究として運営しています。設計や方針はチームで相談して決め、実装をAIエージェントが担う分担です。AIの側がより適切な設計案を示してくることも多く、協働の実感としてはチームの一員に近いと岩田氏は述べています。ただし、何を採用するかという最終的な意思決定は、常に人間のチームが行っています。

あわせて有効だったのは、判断を文書として残すことでした。決定した事項、採用しなかった案とその理由、生じた不具合を各リポジトリのAGENTS.mdに記録し、以後のセッションでAIに最初に読ませています。3つのサービスを一から構築し維持できているのはAIの支援によるところが大きく、人文学の研究者が、外部委託や大規模な開発体制なしには実現できなかったシステムを、自らの研究上の判断と直結した形で作れるようになりつつあると岩田氏は振り返ります。AIが推論しやすい形への作り替えは、未着手の第3層と運用費をまかなう枠組みを課題に残しながら、この協働の上で進んでいます。

講演情報

関連リンク


この記事は、講演記録を基に生成AIを利用して作成したユースケース記事です。