Jan 2026 – Present2026年1月 – 現在
Sakana AISakana AI
Applied Research Engineer (Internship)応用研究エンジニア(インターン)
CURRICULUM VITAE経歴・研究業績
Doctoral Student · Vision and Language Researcher博士後期課程 · 視覚と言語の研究
Exploring the intersection of computer vision and natural language processing, with a focus on multimodal evaluation metrics and context-aware image captioning.コンピュータビジョンと自然言語処理の交差領域を研究しています。特に、マルチモーダルモデルの評価指標と、文脈を考慮した画像説明生成に取り組んでいます。
Jan 2026 – Present2026年1月 – 現在
Applied Research Engineer (Internship)応用研究エンジニア(インターン)
Jun 2024 – Present2024年6月 – 現在
Research Assistantリサーチアシスタント
Jul 2024 – Mar 20252024年7月 – 2025年3月
Engineering Internshipエンジニアリング・インターン
Jul 2022 – Aug 20242022年7月 – 2024年8月
Research Part-timer研究パートタイマー
Vision and Language research at the Language Information Access Technology Team.言語情報アクセス技術チームで視覚と言語の研究に従事。
Jun 2023 – Jan 20242023年6月 – 2024年1月
Research Internship研究インターン
Dec 2021 – Dec 20222021年12月 – 2022年12月
Research Assistantリサーチアシスタント
Aug 2022 – Sep 20222022年8月 – 2022年9月
Summer Internshipサマーインターン
Parameter-efficient pre-training methods for CLIP in Vision and Language tasks.視覚言語タスクに向けた、CLIP のパラメータ効率のよい事前学習手法を研究。
Feb 2021 – Mar 20222021年2月 – 2022年3月
Strategic AI GroupStrategic AI Group
SNS data analysis and annotation guideline creation.SNS データの分析とアノテーションガイドラインの作成。
2024 – Present2024年 – 現在
Vision and Language, Evaluation視覚と言語・評価手法
Focusing on novel evaluation metrics for multimodal systems and cross-modal representation learning.マルチモーダルシステムの新たな評価指標と、モダリティを横断する表現学習を研究。
Advisors:指導教員: Naoaki Okazaki岡崎 直観
2022 – 20242022年 – 2024年
Vision and Language: Image Captioning視覚と言語:画像説明生成
Developed context-aware image captioning models that generate descriptions based on user preferences.ユーザーの好みを考慮し、文脈に応じた説明文を生成する画像説明モデルを開発。
Advisors:指導教員: Naoaki Okazaki岡崎 直観
2018 – 20222018年 – 2022年
NLP: Grammatical Error Correction自然言語処理:文法誤り訂正
Created improved evaluation metrics for grammatical error correction systems.文法誤り訂正システムの評価指標の改善に取り組む。
Advisors:指導教員: Naoaki Okazaki, Masahiro Kaneko (Mentor)岡崎 直観、金子 正弘(メンター)
2025-11-26
Japanese Symposium on Open Large Language Models · Tokyo, Japan · Poster Presentation, Oral SessionJapanese Symposium on Open Large Language Models · 東京 · ポスター発表・口頭発表
Python · PyTorch · JavaPython・PyTorch・Java
Computer Vision · Natural Language Processing · Multimodal Learning · Image Captioning · Evaluation Metricsコンピュータビジョン・自然言語処理・マルチモーダル学習・画像説明生成・評価指標
Japanese (Native) · English (Professional)日本語(母語)・英語(業務・研究)
前田, 航希, 杉浦, 一瑳, 小田, 悠介, 栗田, 修平, 岡崎, 直観
日本語視覚言語モデルのタスク横断評価と実証的分析自然言語処理 · June 2026 · pages 509-536 · 28 pages
Issa Sugiura, Keito Sasagawa, Keisuke Nakao, Koki Maeda, Ziqi Yin, Zhishen Yang, Shuhei Kurita, Yusuke Oda, Ryoko Tokuhisa, Daisuke Kawahara, Naoaki Okazaki
Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language ModelsThe 3rd Conference on Language Modeling (COLM) · October 2026 · San Francisco, USA · pages (to appear) · 18 pages · Single column
Koki Maeda, Naoaki Okazaki
JaWildText: A Benchmark for Vision-Language Models on Japanese Scene Text UnderstandingInternational Conference on Document Analysis and Recognition (ICDAR 2026) · March 2026 · pages (to appear) · 18 pages
Masanari Ohi, Koki Maeda, Ryuto Koike, Daisuke Oba, Nakamasa Inoue, Naoaki Okazaki
From Correspondence to Actions: Human-Like Multi-Image Spatial Reasoning in Multi-modal Large Language ModelsInternational Conference on Machine Learning (ICML 2026) · February 2026 · pages (to appear) · 15 pages · Double column
Youmi Ma, Sakae Mizuki, Kazuki Fujii, Taishi Nakamura, Masanari Ohi, Hinari Shimada, Taihei Shiotani, Koshiro Saito, Koki Maeda, Kakeru Hattori, Takumi Okamoto, Shigeki Ishida, Rio Yokota, Hiroya Takamura, Naoaki Okazaki
Building instruction-tuning datasets from human-written instructions with open-weight large language modelsThe 2nd Conference on Language Modeling (COLM) · October 2025 · Montreal, Canada · pages (to appear) · 17 pages · Single column
Koshiro Saito, Sakae Mizuki, Masanari Ohi, Taishi Nakamura, Taihei Shiotani, Koki Maeda, Youmi Ma, Kakeru Hattori, Kazuki Fujii, Takumi Okamoto, Shigeki Ishida, Hiroya Takamura, Rio Yokota, Naoaki Okazaki
Why We Build Local Large Language Models: An Observational Analysis from 35 Japanese and Multilingual LLMsThe 1st Workshop on Multilingual and Equitable Language Technologies (MELT) · October 2025 · Montreal, Canada · pages (to appear) · 21 pages · Double column
Eri Onami, Taiki Miyanishi, Koki Maeda, Shuhei Kurita
LegalViz: Legal Text Visualization by Text To Diagram GenerationProceedings of the 2025 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers) · 2025 · 20 pages · Double column
Keito Sasagawa, Koki Maeda, Issa Sugiura, Shuhei Kurita, Naoaki Okazaki, Daisuke Kawahara
Constructing Multimodal Datasets from Scratch for Rapid Development of a Japanese Visual Language ModelProceedings of the 2025 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 3: System Demonstrations) · 2025 · pages (to appear) · 15 pages · Double column
Koki Maeda, Tosho Hirasawa, Atsushi Hashimoto, Jun Harashima, Leszek Rybicki, Yusuke Fukasawa, Yoshitaka Ushiku
COM Kitchens: An Unedited Overhead-view Procedural Videos Dataset as a Vision-Language BenchmarkProceedings of The 18th European Conference on Computer Vision (ECCV 2024) · 2024 · 22 pages · Single column
Taku Hasegawa, Kyosuke Nishida, Koki Maeda, Kuniko Saito
DueT: Image-Text Contrastive Transfer Learning with Dual-adapter TuningProceedings of the 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP 2023) · 2023 · pages 13607–13624 · 18 pages · Single column
Koki Maeda, Shuhei Kurita, Taiki Miyanishi, Naoaki Okazaki
Query-based Image Captioning from Multi-context 360-degree ImagesFindings of the Association for Computational Linguistics: EMNLP 2023 · 2023 · pages 6940–6954 · 15 pages · Double column
Koki Maeda, Masahiro Kaneko, Naoaki Okazaki
IMPARA: Impact-Based Metric for GEC Using Parallel DataProceedings of the 29th International Conference on Computational Linguistics (COLING 2022) · 2022 · pages 3578–3588 · 11 pages · Double column
Issa Sugiura, Koki Maeda, Shuhei Kurita, Yusuke Oda, Daisuke Kawahara, Naoaki Okazaki
JAMMEval: A Refined Collection of Japanese Benchmarks for Reliable VLM EvaluationarXiv preprint · April 2026 · arXiv preprint · 16 pages
Koki Maeda, Shuhei Kurita, Taiki Miyanishi, Naoaki Okazaki
Vision Language Model-based Caption Evaluation Method Leveraging Visual Context ExtractionarXiv preprint · February 2024 · arXiv preprint
前田, 航希, 岡崎, 直観
JaWildText: 日本語文字認識性能評価のための実世界画像データセット言語処理学会第32回年次大会 (NLP2026) · March 2026 · pages 613–618 · 6 pages · Double column
大南, 英理, 宮西, 大樹, 前田, 航希, 栗田, 修平
多言語での判例事実概要からの法的関係性のグラフ可視化言語処理学会第31回年次大会 (NLP2025) · March 2025 · 6 pages · Double column
笹川, 慶人, 前田, 航希, 杉浦, 一瑳, 栗田, 修平, 岡崎, 直観, 河原, 大輔
LLM-jp-3 VILA: 日本語マルチモーダルデータセット及び強力な日本語マルチモーダルモデルの構築言語処理学会第31回年次大会 (NLP2025) · March 2025 · 6 pages · Double column
前田, 航希, 杉浦, 一瑳, 小田, 悠介, 栗田, 修平, 岡崎, 直観
llm-jp-eval-mm: 日本語視覚言語モデルの自動評価基盤言語処理学会第31回年次大会 (NLP2025) · March 2025 · 6 pages · Double column
Youmi Ma, 水木, 栄, 藤井, 一喜, 中村, 泰士, 大井, 聖也, 島田, 比奈理, 塩谷, 泰平, 齋藤, 幸史郎, 前田, 航希, 服部, 翔, 岡本, 拓己, 石田, 茂樹, 横田, 理央, 高村, 大也, 岡崎, 直観
模倣学習による大規模言語モデルの指示チューニング言語処理学会第31回年次大会 (NLP2025) · March 2025 · 6 pages · Double column
服部, 翔, 水木, 栄, 藤井, 一喜, 中村, 泰士, 塩谷, 泰平, 植木, 快, 新妻, 巧朗, 川畑, 輝, 田森, 秀明, Youmi Ma, 前田, 航希, 大井, 聖也, 齋藤, 幸史郎, 岡本, 拓己, 石田, 茂樹, 横田, 理央, 高村, 大也, 岡崎, 直観
新聞記事からつくる時事と社会に強い日本語LLM言語処理学会第31回年次大会 (NLP2025) · March 2025 · 6 pages · Double column
服部, 翔, 岡崎, 直観, 水木, 栄, 藤井, 一喜, 中村, 泰士, 大井, 聖也, 塩谷, 泰平, 齋藤, 幸史郎, Youmi Ma, 前田, 航希, 岡本, 拓己, 石田, 茂樹, 横田, 理央, 高村, 大也
Swallowコーパスv2: 教育的な日本語ウェブコーパスの構築言語処理学会第31回年次大会 (NLP2025) · March 2025 · 6 pages · Double column
前田 航希, 長谷川 騎平, 栗田 修平, 小田 悠介, 徳久 良子, 岡崎 直観
日本の文化常識・日常生活知識理解のための視覚言語ベンチマーク MECHA-Ja の構築情報処理学会 第263回自然言語処理研究会 研究報告 (2024-NL-263) · 2024 · pages 1–7 · 7 pages · Single column
橋本, 敦史, 前田, 航希, 平澤, 寅庄, 原島, 純, RYBICKI, Leszek, 深澤, 祐援, 牛久, 祥孝
調理作業理解のための言語資源付き固定視点映像データセットの構築2024年度人工知能学会全国大会(第38回) · 2024 · 4 pages · Double column
前田, 航希, 栗田, 修平, 宮西, 大樹, 岡崎, 直観
視覚的文脈を利用した視覚言語モデルによる画像キャプション生成自動評価手法言語処理学会第30回年次大会 (NLP2024) · March 2024 · pages 1996–2001 · 6 pages · Double column
西田, 京介, 長谷川, 拓, 前田, 航希, 齋藤, 邦子
DueT: 視覚・言語のDual-adapter Tuningによる基盤モデル言語処理学会第29回年次大会 (NLP2023) · March 2023 · pages 1586–1591 · 6 pages · Double column
前田, 航希, 栗田, 修平, 宮西, 大樹
QuIC-360◦: 360◦ 画像に対するクエリ指向画像説明文生成のためのデータセット構築言語処理学会第29回年次大会 (NLP2023) · March 2023 · pages 3013–3018 · 6 pages · Double column
前田, 航希, 金子, 正弘, 岡崎, 直観
IMPARA: パラレルデータにおける修正の影響度に基づいた文法誤り訂正の自動評価法言語処理学会第28回年次大会 (NLP2022) · March 2022 · pages 328–333 · 6 pages · Double column