いまのAIにできないことは、次のAIができることが多い
「できない」は、試した日の話。日付をつけて覚えておく
AIに頼んでできなかったことを、AIにはできないと決めてしまいがちだ。しかし、それは試した日のAIの話で、AIは次々に新しいものへ入れ替わる。プログラムの問題を解くテストでは、2023年に4.4%だった正答率が、一年後に71.7%になった。ソフトウェアの仕事では、AIがやりとげられる仕事の長さが、およそ7か月ごとに2倍になってきたという測定もある。ただし全部ではなく、針の時計を読むテストでは、いちばん成績のよいAIでも正解は半分ほどだった。できなかったことは日付をつけて書きとめ、新しいAIが出たらもう一度頼んでみる。
AIに頼んでできなかったことを、「AIにはできない」と決めてしまうと、あとで損をする。その「できない」は、試した日のAIの話だからだ。一年で正答率が大きく変わったテストの例と、変わらずに残っている苦手の例を、動く図解で追う。
動画で触れた数字
- 4.4% → 71.7%: スタンフォード大学の「AI Index Report 2025」による。SWE-bench というテスト(公開されているプログラムの実際の問題を、AIに直させる)で、AIが解けた割合。2023年が4.4%、2024年が71.7%。
- およそ7か月ごとに2倍: 研究機関 METR の2025年3月の報告による。測っているのは、「人がやるとこれだけ時間がかかる仕事を、AIが50%の確率でやりとげられる」という長さで、AIが一人で働き続けられる時間ではない。対象は、ソフトウェア開発などの仕事。2019年から2025年までの傾向で、METR は2026年1月の更新で、2023年以降はもっと速い(約131日で2倍)と見積もっている。推定の幅は広い。
- 時計を読むテストで約半分: 「AI Index Report 2026」による。針の時計を読むテスト(ClockBench)で、いちばん成績のよいAIの正答率は50.6%、人は90.1%(同じ報告の要約のページでは50.1%)。同じ報告は、数学オリンピックで金メダルの水準の成績を出したAIがあることも挙げ、得意と苦手がでこぼこしていると説明している。
数字の読み方
- テストの点が上がることと、仕事で役に立つことは、同じではない。METR の2025年7月の実験では、経験のある開発者が当時のAIの道具を使うと、作業にかかる時間が19%長くなった(METR は、2025年はじめの時点の、ひとつの場面の結果だと説明している)。
- 「できないことは、次のAIで必ずできるようになる」とは言えない。動画の題も「ことが多い」としている。
- どのAIで、いつ試したかを書きとめておくと、次に試すときに比べられる。
ナレーション
- 00:00 – 00:09 試して、できなかった AIに頼んでみたら、できませんでした。そこで、AIにはできない、と決めてしまっていませんか。
- 00:09 – 00:21 試した日の話 そのできないは、試した日の、AIの話です。AIは、次々に、新しいものへ入れ替わっていきます。
- 00:21 – 00:39 一年で変わった例 例を、ひとつ。プログラムの問題を解かせるテストがあります。二〇二三年のAIが解けたのは、四・四パーセントでした。一年後には、七十一・七パーセントになりました。
- 00:39 – 00:51 仕事の長さ ソフトウェアの仕事では、AIがやりとげられる仕事の長さが、およそ七か月ごとに、二倍になってきた、という測定もあります。
- 00:51 – 01:05 全部ではない ただし、全部ではありません。針の時計を読むテストでは、いちばん成績のよいAIでも、正しく読めたのは、半分ほどでした。残る苦手も、あります。
- 01:05 – 01:21 まとめ だから、できなかったことは、日付をつけて、書きとめておきましょう。新しいAIが出たら、同じことを、もう一度、頼んでみる。できないは、いまの話です。