1
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

才能にたよらない耳コピ -- 8年ぶりのAI対決

1
Last updated at Posted at 2026-09-07

概要

8年前にわたしが書いた記事のフォローアップです。わたしの書いた古き良き DSP タイプの耳コピのプログラムと当時出たての深層学習モデルを比較した記事です。その後の AI の進歩は目覚ましいものがありました。今回このプログラムをベースに iOS/macOS アプリを作ったのを機会に、現在の最新の AI モデルと耳コピ対決してみた記録です。わたしのコードは(ベースは)変わってないので、予想通りの惨敗でした。ここまで AI が進歩した今、わたしたちは何を目指すのか?

はじめに

わたしは昔から耳コピに興味があったが音感がいいわけではなかったのでコンピュータを使って遊んでいました。そうして書いたプログラム WaoN を最初に公開したのはもう30年近く前です。その後も多少の改良をしてきました。 Qiita に記事『グーグルMagentaの採譜プログラムと自分のプログラムを比べたら互角の勝負だったという話』を書いたのは 2018 年のことです。
Screenshot 2026-09-07 at 17.04.43.png
そのあと、この辺のはなしを技術同人誌『音楽と数理 才能にたよらない耳コピ』にまとめて、技術書典に参加したのが 2020 年。そのときの顛末も Qiita に書きました:『技術書典9ドタバタ出典記〜20日で本『音楽と数理』を書いたはなし』
Screenshot 2026-09-07 at 17.04.55.png

今日はそのはなしの8年後の後日談です。

その後の耳コピ

前回の記事から8年以上たった 2026 年の今の状況を見渡してみましょう。

わたしの書いた github で公開してる耳コピ支援ソフト WaoN は、約10年前に version 0.11 を出してから更新がありません。これは、実質的にわたしが考えることはすべてやり尽くして、これ以上やることがなくなったから -- 言い換えると、ほかにいいアイデアが湧いてこなかったということです。古き良き(つまり機械学習や AI モデルではない) DSP のプログラムです。その中でも phase vocoder のアイデアを使った点は特徴的であり neat なプログラムだと思ってます。

最近の DAW (たとえば Logic Pro や Ableton Live)には、デフォルトで音源から MIDI に変換する機能が付いていて、それらの性能はそんなに悪くありません(WaoN の作者としては、 WaoN より特別に優れているとは感じないくらいだと思っていますが)。

そうした中、先日ネットで見かけた MuScriptor というページを試してみたところ、さすがのわたしも「すげぇ」と思ってしまいました。今日の競争相手はこのモデルです。

その後の WaoN

わたしの WaoN は、アイデアが枯渇して開発は止まっていると言いました。一方、最近のコーディング AI の進歩は誰もが目を見張るものであり、今年に入ってから、食わず嫌いだったわたしも半年ほど仕事でみっちりと Claude / Codex を使い、その威力を実体験として感じてきました。そういうこともあって、ここ1ヶ月ほど試しに開発が停滞していた WaoN のリファクターからはじめてみました。最初は、すでに obsolete な GTK2 だった GUI 版 gWaoN を GTK4 対応にすることでした。これが、みなさんも体験していると思いますが、あっけなくできてしまいました。そこで、もう少しチャレンジングな課題をやらせてみようと思って、 iOS/macOS アプリを作ってみることにしました。解析部分は C のままで、 GUI を Swift で全面的に書き直す形にして、計画を立てて、実装させました。そしたら、こちらも(多少は時間が掛かりましたが)満足いくものができました。

この iOS/macOS アプリは「わおん」とリブランドして、アプリに使ったコア部分はデュアルライセンスする形で、有料アプリ(In-App Purchase で制限解除される形)にしました。オリジナルの WaoN はこれまで通り GPL のままオープンソースで公開をつづけます。

本日のお題

ということで、今回は8年ぶりの耳コピ対決、「わおん」vs「MuScriptor」です!

お題は、時代の流れを実感するためにも、前回(2018 年)と同じ音源、 Stevie Wonder の「Golden Lady」の Brad Mehldau のソロピアノでの演奏の冒頭1分を使うことにします。(cf. 素材の準備)

わおん — Music Transcriber

基本的に、解析エンジンはオリジナルの WaoN と同じなので、採譜された音は本質的に同じはずです。

Screenshot 2026-09-07 at 16.17.35.png

このスクショは macOS 版「わおん」の画面です。みて分かる通り、比較的よく採れていますが、高音域にある倍音成分を「音」として採ってしまってます。再生すると分かりますが、ブラッド先生が演奏している音との忠実度は高くありません。出力された MIDI ファイル (brad-1min_waon.mid) を Logic Pro で開き Score 表示させたものがこちらです。

Screenshot 2026-09-07 at 18.12.46.png

Logic Pro で余分な高音域を編集してカットしたものを wav にしたものがこちらになります。

brad-1min_waon_edit.wav

これを聞くと(8年前の繰り返しになりますが)結構健闘していると思います。(倍音を含め)余分な音も採っていますが、ハーモニーを理解したいときの補助ツールとしては役に立つと思います。

MuScriptor

MuScriptor は、ちょっと前にしゃべる AI で話題になった(と思う) /kyutai が作った音楽解析 AI モデルです。ウェブページがあって、アカウント登録なしで、音源をアップロードすれば採譜してくれます。このモデルの特徴は、単なる採譜モデルではなく、音楽制作などで重要となる STEM 抽出(音源を楽器別に分離すること)も含まれていることです。

Screenshot 2026-09-07 at 15.56.56.png

では早速試してみましょう。 brad-1min.mp3 を acoustic piano で採譜した結果がこちらです。

Screenshot 2026-08-29 at 19.04.53.png

結果の MIDI ファイル (brad-1min_muscriptor.mid) を Logic Pro に読み込ませて Score 表示したものがこちらです。

Screenshot 2026-09-07 at 18.02.21.png

またこの MIDI ファイルを fluidsynth で wav にしたものはこちらです。
brad-1min_muscriptor.wav

これを聞けば分かる通り、この採譜は他のアプリの結果と比べても比較にならないほど完璧と言ってもいいものです。

本日の結果

8年前の結果も含めて考えましょう。つまり以下の4つの勝負ということになります:

  • WaoN
  • わおん( = WaoN)
  • Google Magenta のモデル (2018)
  • MuScriptor

このうち3つはほぼ同じ(というのは8年前の総評)で、 MuScriptor はそれらに対して圧勝という結果です。というよりも、今回の MuScriptor の採譜結果はほぼ完璧と言ってもいいと思いました。

AI の進歩はすごいですね。というか、 2026 年の今、みんな実感しているように AI の能力は人間のレベルを超えたと言っていいのでしょうね。なんというか、複雑な気分です。

これからの世の中のためのアプリ

ここまで AI (コンピュータ)が発達した世の中で、われわれ人間は何を目指して生きればいいのでしょうか?いわゆる雑用的なタスクは自分でやる必要はなくなるのでしょう。本当にやりたいことに集中できる世の中になるのかもしれません。本当にやりたいことまでコンピュータに delegate したくはないでしょう。自分自身で、自分の脳みそを使って、自分の手足を使って、やりたいですよね。「耳コピ」も、耳コピを愛する人たちは、自分の耳で、自分の手で、やり続けるでしょう。楽器の演奏などは、自分の生身の体で行いたい活動の典型的なものではないでしょうか。「わおん」は、そういう生身の能力をサポートする部分にも力をいれています。つまり、採譜支援だけでなく、楽器演奏の練習支援にも役にたつアプリだと思っています。

Screenshot 2026-09-07 at 16.37.26.png

今回リリースした iOS/macOS アプリ わおん — Music Transcriber は GUI 版 gWaoN の iOS/macOS 版という形のアプリです。つまり、採譜機能 (CLI 版 waon 由来) に加えて自由再生機能 (pv 由来) も備えています。つまり、再生時の音程を自由に変えられ、再生速度も自由に、2倍や 0.5 倍に変えられるだけでなく、逆再生もできます。さらに「一時停止」しても音が止まりません!これは「耳コピ」マニアには嬉しい機能ですね。

特徴

  • 一時停止しても音が止まらない
  • セッション指向のアプリ
  • 音源の時間制限がない

このアプリを使う時、アカウントやサブスクリプションは一切不要です。アプリの設計思想として「セッション指向」を目指しました。つまり、アプリは状態を保持しないで、その瞬間のデータ処理に専念する。今の場合、与えられた音源を解析し、その結果を出力する。セッションが終われば全て忘れる。入力サンプルを管理するのも、出力結果を保存するのも、責任はユーザーにある。だからアカウントを作る必要もありません(パスワード管理するの、本当に面倒ですよね)。

このアプリは無料でダウンロードできて、その全ての機能が利用可能です。無料版に対する唯一の制限は、音源の 30 秒しか解析できないこと。アプリ内課金で、この制限は解除されます。このとき、音源のサイズに関しては(デバイスのストレージの空きサイズがある限り)制限はありません。1時間のサンプルも読み込めます!

アプリの紹介ページ をつくりました。

Screenshot 2026-09-07 at 17.03.22.png

また note にも記事『1996年に書き始めた「音を音符にする」プログラムを、iPhone・iPad・Macアプリにしました』をアップしました。

Screenshot 2026-09-07 at 17.14.02.png

詳しくはそちらをご覧ください。

アプリに対する要望などありましたら、お気軽にコメントください。

付記(2026/09/08)

わおん — Music Transcriber
version 1.1.0 でました

  • スペクトル左にキーボード表示、全領域表示
  • 画面表示パフォーマンス改善
  • 編集機能、音域選択を追加
    など

iOS だけでなく macOS でも遊べます
Screenshot 2026-09-08 at 9.22.39.png

付記2(2026/09/08)

YouTube に解説ビデオをアップしました。

付記3(2026/10/04)

DTMステーションの藤本健さんに、わおんの機能と開発の背景を紹介していただきました。

30年かけて育てた自動耳コピ「WaoN」がiOS/Macアプリに!AI時代にあえて挑む、0倍速でも音が鳴り続ける「わおん」
dtmstation-20261004.png
DTMステーション / 2026年10月4日公開 / PR記事(有料タイアップ)

1
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
1
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?