CURRICULUM VITAE経歴・研究業績

Koki Maeda前田 航希.

Doctoral Student · Vision and Language Researcher博士後期課程 · 視覚と言語の研究

Research focus研究内容

Exploring the intersection of computer vision and natural language processing, with a focus on multimodal evaluation metrics and context-aware image captioning.コンピュータビジョンと自然言語処理の交差領域を研究しています。特に、マルチモーダルモデルの評価指標と、文脈を考慮した画像説明生成に取り組んでいます。

  • Designing instruction-tuned multimodal LLMs and evaluation pipelines that balance academic rigor with deployability.学術的な厳密さと実環境での利用を両立する、指示チューニング済みマルチモーダル大規模言語モデルと評価手法の設計。
  • Building curated Japanese-language datasets for captioning, reasoning, and cultural understanding in vision-language systems.画像説明生成・推論・文化理解に向けた、日本語の高品質な視覚言語データセットの構築。
03 / BACKGROUND03 / 経歴

Experience職歴・インターン

Jan 2026 – Present2026年1月 – 現在

Sakana AISakana AI

Applied Research Engineer (Internship)応用研究エンジニア(インターン)

Jun 2024 – Present2024年6月 – 現在

National Institute of Informatics国立情報学研究所

Research Assistantリサーチアシスタント

Jul 2024 – Mar 20252024年7月 – 2025年3月

Cierpa & CompanyCierpa & Company

Engineering Internshipエンジニアリング・インターン

Jul 2022 – Aug 20242022年7月 – 2024年8月

RIKEN AIP理化学研究所 革新知能統合研究センター(AIP)

Research Part-timer研究パートタイマー

Vision and Language research at the Language Information Access Technology Team.言語情報アクセス技術チームで視覚と言語の研究に従事。

Jun 2023 – Jan 20242023年6月 – 2024年1月

OMRON SINIC XOMRON SINIC X

Research Internship研究インターン

Dec 2021 – Dec 20222021年12月 – 2022年12月

Tokyo Institute of Technology東京工業大学

Research Assistantリサーチアシスタント

Aug 2022 – Sep 20222022年8月 – 2022年9月

NTT Research InstituteNTT 研究所

Summer Internshipサマーインターン

Parameter-efficient pre-training methods for CLIP in Vision and Language tasks.視覚言語タスクに向けた、CLIP のパラメータ効率のよい事前学習手法を研究。

Feb 2021 – Mar 20222021年2月 – 2022年3月

Future Corporationフューチャー株式会社

Strategic AI GroupStrategic AI Group

SNS data analysis and annotation guideline creation.SNS データの分析とアノテーションガイドラインの作成。

04 / EDUCATION04 / 学歴

Education学歴

2024 – Present2024年 – 現在

Ph.D., Tokyo Institute of Technology東京工業大学 博士後期課程

Vision and Language, Evaluation視覚と言語・評価手法

Focusing on novel evaluation metrics for multimodal systems and cross-modal representation learning.マルチモーダルシステムの新たな評価指標と、モダリティを横断する表現学習を研究。

Advisors:指導教員: Naoaki Okazaki岡崎 直観

2022 – 20242022年 – 2024年

M.Eng., Tokyo Institute of Technology東京工業大学 修士課程(工学)

Vision and Language: Image Captioning視覚と言語:画像説明生成

Developed context-aware image captioning models that generate descriptions based on user preferences.ユーザーの好みを考慮し、文脈に応じた説明文を生成する画像説明モデルを開発。

Advisors:指導教員: Naoaki Okazaki岡崎 直観

2018 – 20222018年 – 2022年

B.Eng., Tokyo Institute of Technology東京工業大学 学士課程(工学)

NLP: Grammatical Error Correction自然言語処理:文法誤り訂正

Created improved evaluation metrics for grammatical error correction systems.文法誤り訂正システムの評価指標の改善に取り組む。

Advisors:指導教員: Naoaki Okazaki, Masahiro Kaneko (Mentor)岡崎 直観、金子 正弘(メンター)

05 / COMMUNITY05 / 講演・発表

Talks & Workshops招待講演・ワークショップ

2025-11-26

評価の観点から見る国産VLMの現状 ↗

Japanese Symposium on Open Large Language Models · Tokyo, Japan · Poster Presentation, Oral SessionJapanese Symposium on Open Large Language Models · 東京 · ポスター発表・口頭発表

06 / RECOGNITION06 / 受賞・支援

Awards & Fellowships受賞・フェローシップ

  • Young Scientist Award, ANLP (2025)言語処理学会 若手奨励賞(2025年)
  • Committee Special Awarded Paper, ANLP (2026, 2025, 2023)言語処理学会 委員特別賞(2026年・2025年・2023年)
  • Program for Development of Co-creative Experts towards Top-level AI Research (Science Tokyo BOOST) for Science and Engineering fields (2024–2027)東京科学大学 BOOST:次世代AI分野を先導する共創型トップ研究者育成(理工系、2024–2027年)
  • Awarded Paper, ANLP (2022)言語処理学会 優秀賞(2022年)
07 / TOOLKIT07 / 専門分野

Skills & Expertiseスキル・専門分野

Programmingプログラミング

Python · PyTorch · JavaPython・PyTorch・Java

Research Areas研究分野

Computer Vision · Natural Language Processing · Multimodal Learning · Image Captioning · Evaluation Metricsコンピュータビジョン・自然言語処理・マルチモーダル学習・画像説明生成・評価指標

Languages言語

Japanese (Native) · English (Professional)日本語(母語)・英語(業務・研究)

PUBLICATIONS研究業績

Full publication list全研究業績

Journal Articlesジャーナル論文

  1. 前田, 航希, 杉浦, 一瑳, 小田, 悠介, 栗田, 修平, 岡崎, 直観

    日本語視覚言語モデルのタスク横断評価と実証的分析

    自然言語処理 · June 2026 · pages 509-536 · 28 pages

International Conferences国際会議

  1. Issa Sugiura, Keito Sasagawa, Keisuke Nakao, Koki Maeda, Ziqi Yin, Zhishen Yang, Shuhei Kurita, Yusuke Oda, Ryoko Tokuhisa, Daisuke Kawahara, Naoaki Okazaki

    Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language Models

    The 3rd Conference on Language Modeling (COLM) · October 2026 · San Francisco, USA · pages (to appear) · 18 pages · Single column

  2. Koki Maeda, Naoaki Okazaki

    JaWildText: A Benchmark for Vision-Language Models on Japanese Scene Text Understanding

    International Conference on Document Analysis and Recognition (ICDAR 2026) · March 2026 · pages (to appear) · 18 pages

  3. Masanari Ohi, Koki Maeda, Ryuto Koike, Daisuke Oba, Nakamasa Inoue, Naoaki Okazaki

    From Correspondence to Actions: Human-Like Multi-Image Spatial Reasoning in Multi-modal Large Language Models

    International Conference on Machine Learning (ICML 2026) · February 2026 · pages (to appear) · 15 pages · Double column

  4. Youmi Ma, Sakae Mizuki, Kazuki Fujii, Taishi Nakamura, Masanari Ohi, Hinari Shimada, Taihei Shiotani, Koshiro Saito, Koki Maeda, Kakeru Hattori, Takumi Okamoto, Shigeki Ishida, Rio Yokota, Hiroya Takamura, Naoaki Okazaki

    Building instruction-tuning datasets from human-written instructions with open-weight large language models

    The 2nd Conference on Language Modeling (COLM) · October 2025 · Montreal, Canada · pages (to appear) · 17 pages · Single column

  5. Koshiro Saito, Sakae Mizuki, Masanari Ohi, Taishi Nakamura, Taihei Shiotani, Koki Maeda, Youmi Ma, Kakeru Hattori, Kazuki Fujii, Takumi Okamoto, Shigeki Ishida, Hiroya Takamura, Rio Yokota, Naoaki Okazaki

    Why We Build Local Large Language Models: An Observational Analysis from 35 Japanese and Multilingual LLMs

    The 1st Workshop on Multilingual and Equitable Language Technologies (MELT) · October 2025 · Montreal, Canada · pages (to appear) · 21 pages · Double column

  6. Eri Onami, Taiki Miyanishi, Koki Maeda, Shuhei Kurita

    LegalViz: Legal Text Visualization by Text To Diagram Generation

    Proceedings of the 2025 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers) · 2025 · 20 pages · Double column

  7. Keito Sasagawa, Koki Maeda, Issa Sugiura, Shuhei Kurita, Naoaki Okazaki, Daisuke Kawahara

    Constructing Multimodal Datasets from Scratch for Rapid Development of a Japanese Visual Language Model

    Proceedings of the 2025 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 3: System Demonstrations) · 2025 · pages (to appear) · 15 pages · Double column

  8. Koki Maeda, Tosho Hirasawa, Atsushi Hashimoto, Jun Harashima, Leszek Rybicki, Yusuke Fukasawa, Yoshitaka Ushiku

    COM Kitchens: An Unedited Overhead-view Procedural Videos Dataset as a Vision-Language Benchmark

    Proceedings of The 18th European Conference on Computer Vision (ECCV 2024) · 2024 · 22 pages · Single column

  9. Taku Hasegawa, Kyosuke Nishida, Koki Maeda, Kuniko Saito

    DueT: Image-Text Contrastive Transfer Learning with Dual-adapter Tuning

    Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP 2023) · 2023 · pages 13607–13624 · 18 pages · Single column

  10. Koki Maeda, Shuhei Kurita, Taiki Miyanishi, Naoaki Okazaki

    Query-based Image Captioning from Multi-context 360-degree Images

    Findings of the Association for Computational Linguistics: EMNLP 2023 · 2023 · pages 6940–6954 · 15 pages · Double column

  11. Koki Maeda, Masahiro Kaneko, Naoaki Okazaki

    IMPARA: Impact-Based Metric for GEC Using Parallel Data

    Proceedings of the 29th International Conference on Computational Linguistics (COLING 2022) · 2022 · pages 3578–3588 · 11 pages · Double column

arXiv PreprintsarXiv プレプリント

  1. Issa Sugiura, Koki Maeda, Shuhei Kurita, Yusuke Oda, Daisuke Kawahara, Naoaki Okazaki

    JAMMEval: A Refined Collection of Japanese Benchmarks for Reliable VLM Evaluation

    arXiv preprint · April 2026 · arXiv preprint · 16 pages

  2. Koki Maeda, Shuhei Kurita, Taiki Miyanishi, Naoaki Okazaki

    Vision Language Model-based Caption Evaluation Method Leveraging Visual Context Extraction

    arXiv preprint · February 2024 · arXiv preprint

Domestic Conferences国内会議

  1. 前田, 航希, 岡崎, 直観

    JaWildText: 日本語文字認識性能評価のための実世界画像データセット

    言語処理学会第32回年次大会 (NLP2026) · March 2026 · pages 613–618 · 6 pages · Double column

  2. 大南, 英理, 宮西, 大樹, 前田, 航希, 栗田, 修平

    多言語での判例事実概要からの法的関係性のグラフ可視化

    言語処理学会第31回年次大会 (NLP2025) · March 2025 · 6 pages · Double column

  3. 笹川, 慶人, 前田, 航希, 杉浦, 一瑳, 栗田, 修平, 岡崎, 直観, 河原, 大輔

    LLM-jp-3 VILA: 日本語マルチモーダルデータセット及び強力な日本語マルチモーダルモデルの構築

    言語処理学会第31回年次大会 (NLP2025) · March 2025 · 6 pages · Double column

  4. 前田, 航希, 杉浦, 一瑳, 小田, 悠介, 栗田, 修平, 岡崎, 直観

    llm-jp-eval-mm: 日本語視覚言語モデルの自動評価基盤

    言語処理学会第31回年次大会 (NLP2025) · March 2025 · 6 pages · Double column

  5. Youmi Ma, 水木, 栄, 藤井, 一喜, 中村, 泰士, 大井, 聖也, 島田, 比奈理, 塩谷, 泰平, 齋藤, 幸史郎, 前田, 航希, 服部, 翔, 岡本, 拓己, 石田, 茂樹, 横田, 理央, 高村, 大也, 岡崎, 直観

    模倣学習による大規模言語モデルの指示チューニング

    言語処理学会第31回年次大会 (NLP2025) · March 2025 · 6 pages · Double column

  6. 服部, 翔, 水木, 栄, 藤井, 一喜, 中村, 泰士, 塩谷, 泰平, 植木, 快, 新妻, 巧朗, 川畑, 輝, 田森, 秀明, Youmi Ma, 前田, 航希, 大井, 聖也, 齋藤, 幸史郎, 岡本, 拓己, 石田, 茂樹, 横田, 理央, 高村, 大也, 岡崎, 直観

    新聞記事からつくる時事と社会に強い日本語LLM

    言語処理学会第31回年次大会 (NLP2025) · March 2025 · 6 pages · Double column

  7. 服部, 翔, 岡崎, 直観, 水木, 栄, 藤井, 一喜, 中村, 泰士, 大井, 聖也, 塩谷, 泰平, 齋藤, 幸史郎, Youmi Ma, 前田, 航希, 岡本, 拓己, 石田, 茂樹, 横田, 理央, 高村, 大也

    Swallowコーパスv2: 教育的な日本語ウェブコーパスの構築

    言語処理学会第31回年次大会 (NLP2025) · March 2025 · 6 pages · Double column

  8. 前田 航希, 長谷川 騎平, 栗田 修平, 小田 悠介, 徳久 良子, 岡崎 直観

    日本の文化常識・日常生活知識理解のための視覚言語ベンチマーク MECHA-Ja の構築

    情報処理学会 第263回自然言語処理研究会 研究報告 (2024-NL-263) · 2024 · pages 1–7 · 7 pages · Single column

  9. 橋本, 敦史, 前田, 航希, 平澤, 寅庄, 原島, 純, RYBICKI, Leszek, 深澤, 祐援, 牛久, 祥孝

    調理作業理解のための言語資源付き固定視点映像データセットの構築

    2024年度人工知能学会全国大会(第38回) · 2024 · 4 pages · Double column

  10. 前田, 航希, 栗田, 修平, 宮西, 大樹, 岡崎, 直観

    視覚的文脈を利用した視覚言語モデルによる画像キャプション生成自動評価手法

    言語処理学会第30回年次大会 (NLP2024) · March 2024 · pages 1996–2001 · 6 pages · Double column

  11. 西田, 京介, 長谷川, 拓, 前田, 航希, 齋藤, 邦子

    DueT: 視覚・言語のDual-adapter Tuningによる基盤モデル

    言語処理学会第29回年次大会 (NLP2023) · March 2023 · pages 1586–1591 · 6 pages · Double column

  12. 前田, 航希, 栗田, 修平, 宮西, 大樹

    QuIC-360◦: 360◦ 画像に対するクエリ指向画像説明文生成のためのデータセット構築

    言語処理学会第29回年次大会 (NLP2023) · March 2023 · pages 3013–3018 · 6 pages · Double column

  13. 前田, 航希, 金子, 正弘, 岡崎, 直観

    IMPARA: パラレルデータにおける修正の影響度に基づいた文法誤り訂正の自動評価法

    言語処理学会第28回年次大会 (NLP2022) · March 2022 · pages 328–333 · 6 pages · Double column