はじめに
DiHuCoハブシンポジウム2026:Agentic DHに向けて~人文学×AIの多様化とAI協働型研究の広がり(2026年8月7日、一橋講堂)のセッション4では、文部科学省のAI for Science萌芽的挑戦研究創出事業(SPReAD)に採択された10名が、これから進める研究についてライトニングトークとポスター発表を行いました。
SPReAD(通称 SPReAD 1000)は、人文学、社会科学から自然科学までのあらゆる分野の研究者等を対象に、AIを利活用した萌芽的・探索的な研究を機動的に支援する事業です。2回の公募を通じて計1,000件程度の採択を予定しており、AI利活用の初心者を歓迎しています。第1回公募には15,868件の応募があり、採択は456件、採択割合は2.9%でした。第1回の研究期間は、交付決定日から令和9年1月6日までです。
主催者はこのセッションについて、採択者が成果を発表する場ではなく、AIを用いて実現したいことを議論し、今後の研究に向けた情報を交換する場と位置付けました。セッションの冒頭で主催者は、研究期間が約半年と短いことから、発表者と参加者の間でさまざまな情報を交換したいという意図を説明しています。
主催者は、第1回公募の採択者のうち芸術・人文科学および社会科学の分野の方々に参加を呼びかけ、10件の発表申込がありました。研究領域は芸術・人文科学が6件、社会科学が4件です。対象は、歴史的文書から作る知識グラフ、学術調査写真、皮革文化財、国際法を支える規範意識、仏教漢文、文化遺産を扱う生成AI、LLM同士の対話、近代の海外移民、郷土芸能、近代の工場名簿と幅広く、分野もそれぞれ異なります。
この記事の取りまとめにあたっては、各発表の課題名、研究目的、ライトニングトークの講演資料と文字起こし、ポスターのデータを用いました。個々の発表の内容を要約するのではなく、発表に共通して見られる取り組みの傾向、発表者が示した可能性、課題、支援や助言が求められている点を、論点ごとにまとめています。
論点1:AIを使う研究環境の整え方
複数の発表が、どこでAIを動かすか、どのモデルやツールを選ぶか、コードをどう書くかという、研究環境の整備に取り組んでいます。手元のローカル環境でLLMを動かす計画が複数の発表に見られます。未公開の学術調査写真を解析する研究、機微情報や著作権で保護された資料を扱う国際法の研究、個人情報をローカルのLLMで扱う計画の歴史地理の研究がその例です。
また、Claude CodeやCodexなどのコーディング支援を研究の進め方に組み込む計画が複数の発表で示されています。ある発表では、プログラマではない研究者が実験の設計と判断を担い、Claude Code上に作成とレビューを分けたエージェントの組織を置いたうえで、別のモデルを外部のレビュワーとし、コードと統計の最終確認を人間の補助者が行う体制をとっています。一方で、研究にAIを用いるのは今回が初めてという発表や、LLMやマルチエージェント・シミュレーションには初心者だとする発表もあります。
可能性:Pythonでコードを書けない発表者が、Geminiにコードを生成させて画像認識システムの実装を進めており、生成AIによるコード作成を非常に有用だと述べています。前述の研究では、LLMを実験の対象であると同時に、研究を遂行する基盤としても位置づけています。ローカル環境については、未公開の画像や機密性の高いデータを外部に送り出さずに解析できる環境を実現することが目指されています。
課題:AI技術の進展が速いため、より適切なモデルを選び、継続的に更新していく必要性が感じられています。ローカル環境で実行できるLLMにどのような選択肢があるのかも、課題として挙げられています。生成AIによるコード作成では、プロンプトや指示が不十分な場合に意図と異なるコードが生成されることがあり、生成されたコードを評価・修正するための知識が求められます。
支援や助言が求められている点:研究を進めるうえで情報学やAIの知識をどの程度習得すべきか、どのツールやモデルをどう選び、どう使えばよいかについて、専門家の助言が求められています。AI導入の段階に応じた情報支援、AI化のサンプル、導入時のメンターがあれば、身近に相談相手がいない研究者でもAI導入を始めやすくなるのではないかという提案もありました。
論点2:AIに渡すデータの整備
史資料や現場の記録をAIが扱える形に整えることが、研究の中心的な工程になっている発表が複数あります。工場名簿や戦前期の海外渡航記録から、工場名・所在地・創業年や人物・地名・時期などの項目をAIで読み取って構造化し、GISと連携して時空間上に位置づける計画があります。仏教漢文の研究では、『国訳一切経』の日本語訳と漢文原典を文レベルで対応づけ、30万文対規模の対訳コーパスを構築することを目標としています。皮革文化財の研究では、自ら撮影した毛穴の画像を学習させ、革の動物種を識別するシステムを構築中です。
一方、現場で新たに記録を集める取り組みもあります。郷土芸能の研究では、保存団体や小中高生がスマートフォンで記録した映像などを集めるプラットフォームを構築し、郷土芸能の衣装に対応した姿勢推定のためのデータセットを作成しています。
可能性:仏教漢文の研究では、専門家が人手で行えば数十年規模の作業となる語分割や品詞付与の情報の多くが、『国訳一切経』の訓読調の日本語訳に暗黙的に反映されているとし、原典との対応関係を学習データとして活用することを目指しています。皮革文化財の研究では、未劣化の革の画像で学習したシステムでは文化財の判定がうまくいかなかったものの、動物種が判明している文化財そのものの画像を学習に加えると正答率が向上しました。郷土芸能の研究でも、汎用の姿勢推定モデルを専用のデータセットで調整すると、精度をある程度向上できることを小規模なデータで確認しています。工場名簿の研究は、中小零細工場を含む都市内の全工場を網羅したデータベースによって、これまで見落とされてきた都市空間の多様性がもつダイナミズムを描き出すことを目指しています。
課題:旧字体や異体字を含む歴史資料では、OCRの精度向上とレイアウトの認識が壁になっています。郷土芸能の動画では、布が体全体を覆う衣装のために骨格の推定が非常に難しくなります。史料の撮影機材やOCRツールがまだ決まっていない取り組みもあります。
支援や助言が求められている点:LLMを用いて資料を構造化するためのプロンプトや、GISとの連携の設計について、意見が求められています。郷土芸能の研究からは、扇子や刀のように動く部位のある小道具の3Dモデル化の方法と、津軽弁や南部弁などの方言の書き起こし方法について、アドバイスが求められています。
論点3:AIの出力の検証
AIが生成・判定した結果をどう確かめるかを、複数の発表が研究の主題や工程の中心に置いています。歴史的文書からLLMが生成した知識グラフの品質を、構文・スキーマ準拠性、オントロジー的整合性、原文との事実一致の3つの軸で、生成に使ったものとは別のLLMに評価させ、大学院生アノテーターによる人手評価との一致を測る研究があります。文化遺産を扱う生成AIの出力を、専門家のペルソナによる合議と実際の専門家による盲評を組み合わせて評価するエージェントを構築する研究もあります。LLM同士の対話の研究は、敬語・終助詞・人称の変化を言語人類学の記述と突き合わせます。
LLMの出力のゆらぎそのものを扱う取り組みもあります。学術調査写真の公開判定では、肖像権ガイドラインに沿った採点案をLLMに出力させ、LLM間の対話を挟みながら、ゆらぎのある出力の中から最適な結果を見つける仕組みを考えています。
可能性:生成と評価に異なる系統のモデルを用いることで、生成したモデルが自分の出力を甘く評価する偏りを避ける設計が示されており、AIが作ったデータをAIで検証する際の方法論的な最小要件を、具体的な人文学データセットで示すことを目指しています。写真の公開判定の研究では、マルチモーダルLLMの出力のゆらぎから、よりよい解析結果が得られることがあるとしています。前述の対話の研究では、現地調査では試せない役割の付与・剥奪・反転を、合成的な環境で操作できます。専門家による盲評との差分をもとに、評価エージェントが自己較正する仕組みも計画されています。
課題:評価に用いるLLMにも系統的な誤判定のパターンが生じうることが、限界として挙げられています。複数の解析結果から最適なものを選ぶ手間をどうするか、人手をかけるほうが早いのではないかという迷いもあります。モデルの更新によって結果が揺れるとき、何を再現の対象とするかは未解決です。
支援や助言が求められている点:評価の観点や改善のアイディアについて、意見が求められていました。AIの出力を検証する定番の手法を知りたい、敬語や終助詞をどの粒度で自動タグ付けするかについてはアノテーション資源や評価単位を知りたい、モデルの更新によって結果が揺れる中での追試についてはOSSモデルのローカル実行や記録すべき項目を知りたいという要望もあります。
まとめ
10件の発表からは、AIを使い始めた段階での手応えと課題の両面が見えてきます。プログラミングを専門としない研究者が生成AIによるコード作成やエージェントを使って研究を進めていること、既存の翻訳資料を学習データとして生かす構想や、動物種が判明している資料を学習に加えて正答率が向上した試行があること、別のモデルや専門家を組み合わせてAIの出力を検証する設計が示されていることは、可能性の側に挙げられます。
コード・データ・評価手法の公開や、誰でも検索・閲覧できるアーカイブの構築を計画する発表も複数あり、評価手法を歴史学以外のDH分野へ、コーパス構築の手法をチベット語や梵語などの他の低資源言語へ広げる構想も示されています。一方で、データ公開に必要な許可・寄託先・費用といった手続きの複雑さや、法学研究でAI for Scienceの取り組みが評価される見通しが立たないことが挙げられ、研究期間後も切れ目なく続く研究費の支援や、何をもって成功と考えるかについての意見が求められています。
論点をまたぐ課題としては、変化の速い中でのモデルやツールの選択、歴史資料のOCRや現場の記録に固有の難しさ、AIの出力をどう検証するかがあります。求められている支援は、情報学の基礎やモデル選択に関する助言、導入段階に応じた情報やメンターといった知識面、OCR・構造化プロンプト・3Dモデル化などの技術面、公開手続きの情報や研究費といった制度面に分けられます。SPReADの事業ページは、AI導入の伴走支援を設ける背景として、データの形式や量、適切なモデルの選択、計算資源の確保、データ管理への対応といった課題と、研究者等の間のAIに関する知識や経験の差を挙げており、発表で示された困りごとの多くはこれらと重なっています。
発表情報
- イベント:DiHuCoハブシンポジウム2026:Agentic DHに向けて~人文学×AIの多様化とAI協働型研究の広がり
- 発表日:2026-08-07
- 対象範囲:SPReAD 1000採択者発表
関連リンク
この記事は、ポスター発表の資料を基に生成AIを利用して作成したIssues記事です。