2026年9月版 LLM総合評価
| 順位 | モデル | 文章 | コーディング | 画像 | 推論力 | トークン | 合計 |
|---|---|---|---|---|---|---|---|
| 1位 | Claude Opus 5.5 | ○ | ◎ | × | ◎ | ◎ | 6 |
| 1位 | GPT sol6 | ○ | ○ | ◎ | ○ | ○ | 6 |
| ー | SuperGrok | ー | ー | ー | ー | ー | 評価対象外 |
| ー | Gemini | ー | ー | ー | ー | ー | 評価対象外 |
3ヶ月ぶりにClaudeへ戻りました
6月25日、私はClaudeを解約しました。これまで一度も解約したことがなかったので、初めての解約です。
理由は、最上級モデルFableのナーフと従量制への移行です。
※ナーフ(nerf)とは、もともとゲーム用語で、アップデートによって性能が弱体化されることを指します。AIの場合は、モデルが更新された結果、以前より回答の質や賢さが落ちたと感じられる状態を指して使われます。
同じ時期にXでのClaude関連のポストも一気に減ったことを考えると、おそらく多くの人が同じことを感じていたのだと思います。
そして今回、3ヶ月ぶりにClaudeへ戻ってきました。
きっかけはGPT側の事情です。sol5.6のナーフとトークンの持ちの悪さで、私の作業量だと実質2時間ほどで5時間制限に達してしまうようになりました。
そんな中、Opus 5.5の評判が良かったので実際に使ってみると――素直になっていました!
賢くなればなるほど余計なお世話をする、というLLM特有の気持ち悪さが無くなっていたのです。
なお、今回FableとAstraを比較に入れていないのは、コストが高すぎて日常的に使えるモデルではないためです。
1年使って分かったこと
私が本格的にAIを使い始めたのは、ちょうど1年前の2025年9月頃。GeminiがまだGemini 2.5だった時期です。
それから1年、実務でみっちり使い込んで分かったのは、AIは「安定して使えるモデルであること」が第一優先だということです。
ここでいう安定とは、性能のブレがないこと。LLMには、新しいモデルが出ると前のモデルがナーフされるという特有の現象があります。意図的ではないにしろ、昨日まで通っていた指示が今日急に通らなくなる。実務では手順ごと組み直しになるので、これが一番つらい。
三歩進んで二歩下がる、みたいなことはほんとにやめてほしいです。LLM側にもリソースの問題があることは重々承知していますが。
仕事で使う以上、性能の上限の高さよりも「下振れしないこと」の方がずっと大事なのです。
正直、今のAIは性能も上がりきっていて、1年前とは比べ物になりません。これ以上、上を目指す意味があるのかとも思います。
実際、9月12日にはAnthropicのダリオ・アモデイCEOが、AIモデルの能力向上のペースを落とすべきだとするエッセイを公開し、OpenAIのアルトマンCEO、イーロン・マスク氏、Google DeepMindのハサビスCEOらも支持を表明しています。
ただ、そうなるとLLMのビジネスモデルも考え直さないといけません。各社まあまあ赤字らしいですから。今は世界人口というパイを、性能アップで取り合っている状態です。
性能競争が落ち着けば、次に選ばれる理由は「安定」やトークンの持ち、料金、ツール連携といった、「毎日使い続けられるか」の部分に移っていくはずです。赤字の中でそこをどう回していくのかが、各社の次の課題になりそうです。
とはいえ、Gemini 4に期待している自分がいる(笑)
性能競争はもういいと言いながら、Gemini 4に期待している自分がいます(笑)。
というのも、出回っているベンチマークがかなり高いのです。AIエージェントのコーディングを測るDeepSWE v1.1で約88%、ターミナル操作のTerminal-bench 2.1で95.3%、コンピューター操作のOSWorld-2.0で86.8%と、GPT-6 AstraやClaude Fable 5.1を上回る数字が並んでいます。
しかも価格は、100万トークンあたり入力2.25ドル、出力11.25ドルとされています。これはGPT-6 Solとほぼ同じ水準で、Opus 5.5の約半額。つまり、最上位モデル級の性能を中位モデルの値段で出してくる、ということになります。そりゃ話題になりますよね。
ただし、これはあくまでリーク情報です。テストされていたのが本当にGemini 4 Proなのかさえ、外部からは断定できないと指摘されています。
正直、これまでのGeminiの酷さを考えると、話半分以下で聞いておくのがちょうどいいと思っています。ベンチマークが良くても、実務で使うと別物だったというのは、この1年で散々見てきましたから。
期待はしつつ、出てきたら実務で使い倒して判断します。
この1年で世界は変わった
私がAIを使い始めた1年前は、まだ世間的には「AIって知ってる?」くらいの感じでした。
それがこの1年で、世界は変わりました。今ではAIの使い方が社会問題としてニュースになるほどです。
この感じ、携帯やスマホが出始めた頃と似ています。依存するとどうだとか、子どもの成長に悪影響だとか、さんざん言われていました。
でも今、スマホが無い生活なんて考えられないですよね。
日本人は保守的で、特に新しいものには懐疑的です。AIもきっと同じ道をたどって、数年後には「無い生活なんて考えられない」存在になっているのだと思います。

