2026年10月1日(米国時間)、Cloudflareが“Clef(クレフ)”というAIを公開しました。文章を書かずに“判断”だけを返すAIで、しかも画像が読める。いわば“画像入力できるJevっぽいやつ”です。
前回の記事では、文章を書かないAI“Jev”(公式サイト)を紹介し、色々と試しました。
Jevは文章を入力し判断を返すAIですが、画像入力には対応していませんでした。判断・分類への相性の良さから、AI界隈では画像入力ができるJevみたいなのが出たら、色々すごいのでは?と期待されておりました。そこで満を持して登場したのが、Clef!!
本記事ではその実力を確かめていきますYo。
Clef君よ・・・君はどのくらい画像を判別できるんだい。ということで、画像分類の王道“CNN”と同じ問題で戦わせてみました。
判断AIで画像分類?・・・普通の画像認識AIと何が違うの?そもそもCNNって何?
って人でも大丈夫です。本記事では、Jevの基本から噛み砕いて説明します。お題は犬猫と、有名ミーム“チワワ or マフィン”の2つ。様々な角度から試していきます。
では、さっそくいきましょう!!
そもそも“Jev”って何だ?
ChatGPTやClaudeのようなLLM(大規模言語モデル)は、次に来る単語(トークン)を1つずつ予測して文章を作るAIです。何でも書ける代わりに、何が返ってくるかは分かりません。
一方のJevは、TypeSafe AIが2026年9月15日に先行提供を始めたAI。State(状況)と、答え方の決まった質問を受け取り、決まった形の答えと確率だけを返します。
たとえば「昨日買ったのに壊れていた」という問い合わせに、Jevが返すのは「種類:製品不良」と「緊急度:0.91」だけ。そのままプログラムで使える判断結果なのです。

答え方は次の3種類で、今回使うのはChoiceです。
- Choice:選択肢から1つ選ぶ
- Score:段階で採点する
- Noul:はい・いいえの確率を返す
マークシート式のテストのようなもので、決まった回答しかしません。文章を生成せず、複数の質問を並列に評価するので、速くて安いのも特徴です。ただし、Jevは画像を読めません。この弱点を解決するモデルが、早くも出てきました。
画像も読める“Clef”って何だ? Jevとの違い
CloudflareのJev互換“判断AI”
Clefは、Cloudflareが公開した判断AIです(発表ブログ/Hugging Face)。大きさは公称27B(判断専用の頭まで含めると約275億パラメータ)で、軽量版の「Clef-flash」(9B)もあります。名前の由来は、楽譜の左端に書く“音部記号”。ClefのCとFは、Cloudflare(CF)にかけている、らしいです。なかなか、オシャンティ。
Cloudflareによると、ClefはJevと同じ系統の判断モデルで、書式にも互換があります。Jevとの大きな違いは、画像を入力できることと、重み(学習で決まったパラメータの値。AIの中身そのもの)が公開されていること。商用利用もできるApache 2.0ライセンスで、自分のGPUでも動かせます。ただし、27B版は重みだけで約55GBあり、家庭用のGPUにはそのままでは載りませんね。
中身は“画像も読めるLLM”+判断専用の頭
土台は、Alibaba(Qwenチーム)が公開している「Qwen3.8-27B」という、画像も読めるLLMです。Cloudflareはこれに判断向けの追加学習をして、選択肢に点数を付ける判断専用の頭を取り付けました。
画像入力は画像を小さなタイルに切り分け、文章の単語と同じように並べて読みます。そして、画像・状況・質問・選択肢をまとめて1回読み込み、文章は1文字も生成せず、選択肢ごとに点数を付けて100%を山分けする。これがClefの答え方の仕組みです。

画像が読めるなら、その性能・・・試さずにはいられないッ!!まずは画像分類の定番で腕試しです。
第1ラウンド:画像分類の定番“犬猫分類”
データは、オックスフォード大学などが2012年に公開した「Oxford-IIIT Pet」(犬25品種・猫12品種)。そのテスト用画像から、犬500枚・猫500枚を品種の比率に合わせて選びました。Clefには英語で「この画像に一番当てはまるカテゴリは?」と聞き、選択肢は「家庭の犬」と「家庭の猫」の2つだけです。

対戦相手は、画像分類の王道“CNN”の代表選手「ResNet-50」。ImageNetという巨大な画像集で学習済みのものを、そのまま使います。結論は如何に・・・の前にぃ、そもそもCNNって何?という人のために、基礎を押さえておきましょう!!
そもそも“CNN”って何だ? 生成AIとの違い
“カーネル”で画像の特徴を拾うAI
CNNは“Convolutional Neural Network”の略で、日本語では畳み込みニューラルネットワークです。ニューラルネットワークとは、脳の神経細胞のつながりをまねた計算の仕組みのこと。今のAIの多くが、これを土台にしています。
“畳み込み”とは、“カーネル”と呼ばれる小さな数値の表(図の例では3×3)を画像の上で少しずつずらしながら、重なった部分の画素の値とカーネルの値を掛けて足し合わせる計算のこと。その結果を並べると、画像のどこにどんな特徴があるかを表す“特徴マップ”ができあがります。たとえば縦線に反応するカーネルなら、縦線がある場所ほど大きな値になります。カーネルの値は人が決めるのではなく、大量の写真と正解から“学習”で自動的に決まります。

CNNは、この畳み込みを何層も重ねます。1層目は線や色の境目、次の層は毛並みや目の模様、深い層では耳や鼻といった部品・・・。層を重ねるほど、大きな特徴を拾っていくんです。2層目は1層目の特徴マップにさらに畳み込みをかけるので、元の写真でいえば、より広い範囲を見ていることになるわけですね。最後に、1,000クラスそれぞれの確率を出します。

生成AIとは何が違う?
今回のResNet-50のような画像分類用のCNNは、“見分ける専門”のAIです。決まった選択肢から選ぶだけで、文章も画像も作りません。そのかわり、小さくて速い。ただし、畳み込みという仕組み自体は、画像生成AIの部品にも使われています。
一方、ChatGPTのようなLLMや、画像・音楽の生成AIは、文章や画像、音楽を“作る”AIで、とにかく巨大です。AIの大きさはパラメータ(学習で調整される数値)の数で表しますが、大きなLLMでは数千億〜1兆級にもなります。今回のResNet-50は約2,556万、Clefは約275億なので、桁が違いますね。
判断AIはその中間。生成AI級の大きな頭脳を使いながら文章は作らず、こちらが書いた選択肢から選びます。いわば“選択肢を書き換えられる分類器”というわけです。

王道になった理由は“ImageNet”と“ResNet”
CNNが王道になったきっかけが、“ImageNet”という巨大な画像データベースです。そこから1,000種類を選んだコンテスト用のデータは学習用だけで約128万枚あり、いわば画像分類の“標準問題集”です。
2012年、このコンテストでトロント大学のCNN「AlexNet」が、誤り率15.3%で優勝しました。2位は26.2%という大差。これが、層を深く重ねたAI=“ディープラーニング”のブーム(第3次AIブーム)の火付け役になります。
2015年の優勝は、Microsoft Researchの「ResNet」。層を深くしすぎると、かえって学習がうまくいかなくなる問題を、層を飛び越える“近道(スキップ接続)”で解決しました。近道で元の入力をそのまま先へ流し、各層は“足りない分(差分)”だけを学べばよくしたのです。

今回のResNet-50は、その50層版です。パラメータは約2,556万で、AI開発の定番ツール“PyTorch”の公式が配る学習済みの重み(2022年に公開された改良版。1,000クラスで1位の答えが正解だった割合は80.9%)を、誰でもすぐ使えます。Clefは約275億パラメータなので、大きさは約1,100倍の差です。

CNNに“犬か猫か”を答えさせるには
今回使用する学習済みのResNet-50が返すのは「1,000クラスそれぞれの確率」なので、“犬か猫か”を直接は聞けません。そこで、ResNet-50が1位に挙げたクラスで判定します。1位が犬種なら“犬”、それ以外なら“猫”です。
| 項目 | Clef | CNN(ResNet-50) |
|---|---|---|
| 今回の課題向けの追加学習 | なし | なし |
| 答え方 | 二択に直接答える | 1,000クラスの中の1位で判定 |
| 大きさ | 約275億パラメータ | 約2,556万パラメータ |
Clefには“犬か猫か”をそのまま聞けて、CNNは1,000クラスの中の1位で判定する、というわけです。では、結果を見ていきましょう。
第1ラウンドの結果は「Clef、普通に良い」
1,000枚の正解数
実験では、犬500枚・猫500枚の写真を1枚ずつClefとCNNに見せ、“犬か猫か”を判定させました。計算には、Googleのクラウド計算環境“Colab”で、データセンター向けの高性能GPU“H100”を借りています。
結果は、Clefが1,000枚中1,000枚正解、なんと100%。CNNは1,000枚中961枚(96.1%)でした。

正直なところ、Clef、普通に良いです。とはいえ、Clefにも1枚だけ、きわどい写真がありました。CNNが正解したキースホンド(ふさふさの犬)の写真で、犬の確率は53%。ほかの999枚は、正解の確率がすべて96%以上でした。

CNNがつまずいた写真
CNNが外した39枚は、ほとんどが2種類の写真でした。
1つ目は、毛のない猫“スフィンクス”(22枚)。1位が毛のない犬種“メキシカン・ヘアレス・ドッグ”などになり、“犬”と判定されました。確かに、ちょっと似ている・・・。
2つ目は、柴犬(15枚)。1位が“ディンゴ”(オーストラリアの野生化した犬)などになりました。ImageNetのディンゴは犬種ではなく、オオカミと同じ“野生のイヌ科”の扱いなので、“犬ではない”と判定されてしまったのです。

では、人間でも一瞬迷う、あの有名な画像ではどうでしょうか?
第2ラウンド:有名ミーム“チワワ or マフィン”
どんなミーム?
2016年3月10日、Karen Zackさん(@teenybiscuit)がTwitterに投稿した「chihuahua or muffin ?」。チワワの顔とブルーベリーマフィンを4×4に並べた画像で、目と鼻がブルーベリーに見えてくる、あの画像です。画像認識AIを試すお題としても有名になりました。

出典:Karen Zack(@teenybiscuit)「Chihuahua or Muffin」シリーズ
あなたは、どれがチワワか一瞬で見分けられますか?
どう戦わせたか
原作者の画像から16マスを切り出し、1マスずつ判定しました(チワワ8・マフィン8)。Clefの選択肢は「チワワ」と「ブルーベリーマフィン」です。
CNNは犬猫と同じく、1位に挙げたクラスで判定します。1位が犬種(Chihuahuaなど)ならチワワ、それ以外ならマフィンです。
結果:どちらも16マス全問正解
結果は、Clefが16マス中16マス、CNNも16マス中16マス。引き分けです!!
CNNは、チワワ8マスすべてで1位に“Chihuahua”を挙げ、マフィン8マスで犬種を1位に挙げることは一度もありませんでした。ImageNetにはChihuahuaのクラスがあるので、ここはCNNの得意分野だったようです。

2ラウンドで見えてきたことを、結論としてまとめます。
結論:Clefは画像分類でも優秀。課題はあるが期待できる
判断AI“Clef”は、画像分類でも優秀でした。追加学習なしで、犬猫1,000枚は全問正解、チワワ or マフィンも16マス全問正解。王道CNN(今回はResNet-50)と比べても、犬猫では上回り、チワワ or マフィンは引き分けです。
| お題 | Clef | CNN(ResNet-50) |
|---|---|---|
| 犬猫1,000枚 | 1,000 | 961 |
| チワワ or マフィン16マス | 16 | 16 |
※どちらも今回の課題向けの追加学習なし。CNNは1位に挙げたクラスで判定
課題①:判断の根拠が見えない
ただし、課題もあります。1つ目は、判断の根拠が見えないこと。Clefが返すのは答えと確率だけで、“なぜそう判断したのか”は分かりません。犬猫でも、キースホンドの写真は犬53%と五分五分まで迷いましたが、その理由は分かりません。精度が求められる場面にそのまま使うのは難しそうですし、使うにしてもコツが要りそうです。
その点CNNには、判断に効いた場所を色で示す“Grad-CAM”のように、判断の根拠を可視化する技術が揃っています。
課題②:速さと軽さはCNNが上
2つ目は、速さ。犬猫1,000枚を同じH100で1枚ずつ処理した時間(真ん中の値=中央値)は、CNN約13ミリ秒に対してClef約285ミリ秒で、約21倍。1秒あたりに直すと、約75枚対約3.5枚です。GPUメモリの使用量も、CNN約0.15GBに対してClef約55GBで、約370倍の差がありました。

Clefは高速化の工夫なしの標準実装で測ったので、伸びしろはあります。それでも、速さと軽さはCNNが圧倒的です。
それでも期待できる理由
それでも、Clefのすごさは揺らぎません。CNNで同じことをするなら、見分けたいクラスに合わせて学習し直すか、今回のように1,000クラスの答えを“犬か猫か”に読み替える必要があります。Clefなら、選択肢を文章で書くだけ。事前準備がほぼ不要で、これだけ画像を分類できるのは本当にすごいことです。
しかも重みが公開されているので、大きなGPUを積んだPCさえ揃えれば、手元でローカル運用もできます。これは熱い!!判断AIの画像分類、これからの進化に期待できそうです。
まとめ
本記事の内容を復習しましょう。
- Jevは文章を書かず、答え方の決まった判断と確率を返すAI。ただし画像は読めない
- Clefは、画像も読めるJev互換の判断AI。重みが公開されていて、大きなGPUがあれば自分でも動かせる
- CNNは、カーネルを使った“畳み込み”で画像の特徴を拾う、画像分類の王道
- 犬猫1,000枚はClefが全問正解でCNN(961枚)を上回り、チワワ or マフィンは両者16マス全問正解の引き分け
- ただしClefは判断の根拠が見えず、速さと軽さはCNNが圧倒的
- それでも、事前準備ほぼ不要でここまで分類でき、ローカルでも動かせるClefには期待大
AIを悩ませそうな“そっくり画像”をご存じでしたら、是非とも教えてください。次の対戦カードにさせてもらいます。
前回の記事(Jevを“判定専用AI”として紹介)
Clefのリンク
Jevのリンク
画像の出典:Karen Zack「Chihuahua or Muffin」シリーズ/Oxford-IIIT Pet
参考





