毎日10米ドル使えるリソース
Kaggle には毎日最大10米ドル、月に100米ドル使える「AI」というリソース(AI Quota)があります。
これは主に「 Kaggle Benchmarks 」という AI モデルの検証プラットフォームで様々な LLM の API を呼び出すために使用できる利用枠です。
上の画像にあるように Kaggle では GPU や TPU の無料枠もあります。こちらは Kaggle Notebook で CNN などの複雑な並列処理を実行するためのマシンリソースです
Kaggle Benchmarks を使う目的は?
Kaggle Benchmarks では、例えばこれらのモデルを比較することができます。
- Claude(Anthropic)
- DeepSeek
- Gemini(Google)
- Gemma(Google)
- GPT(OpenAI)
- Qwen(QwenLM)
- Grok(xAI)
- Glm(Z.ai)
なぜ自らモデルを比較する必要があるのかというと、3つの理由が挙げられます。
1. 自分のタスクに総合ベンチマークが役に立たない場合がある
各モデルの性能について、各社は MMLU(Massive Multitask Language Understanding)などの標準的な AI ベンチマークテストの結果を公開しています。
しかしながら、個別タスクについて、「MMLUスコアが高いから役に立つ」とは言い切れないため、様々なモデルのパフォーマンスを試してみる必要があります。
MMLU は数学以外にも経済学や歴史など多様な学問分野を網羅し、約1.6万問の4択問題で構成された、LLMの知識と推論能力を測定するためのテストです
こちらから試すことができます。
https://huggingface.co/datasets/cais/mmlu
2. レイテンシ、コスト、精度のバランスを知りたい
最も高価な最上位モデルを使わなくても、処理速度が速くてコストが抑えられるようなモデルで目標となるスコアをだせるのであればよい、など最適解を見つけるために役立ちます。
これは、多くの方が少なくとも定性的にはやってきたことでもあると思うのでイメージしやすいと思います。
3. 定点観測
サーバー負荷の軽減や安全性の向上を理由に事業者がモデルの仕様や重み、フィルターなどを更新する場合があります。
そのような状況に対して、様々なモデルで定期的に同じタスクを解かせるといった観察が行えます。
具体的に Kaggle Benchmarks をどう使えるのか
自分自身でタスクまたはベンチマークを作成することができます。
例として「LLM-as-a-Judge(AIに別のAIを採点させる手法)」のタスクコードを紹介します。
以下のコードでは、テストしたい LLM に「爬虫類の名前を重複なく100個リストする」ことを命令し、Gemini 2.5 Proで正誤判定させています。
@bm.task(name="Name 100 Reptile Species")
def name_reptile_species(llm): # ここにClaude や DeepSeek が入る
judge = bm.llms['google/gemini-2.5-pro']
count = 0
prompt_for_names = (
# 100種類の爬虫類の学名を重複なく列挙する
"List 100 different reptile species names. "
"Provide one species name per line, without any numbering, bullet points, or additional introductory/concluding text. "
"Ensure each name is a distinct, real reptile species, and that you use it's scientific name."
)
species_list_response = llm.prompt(prompt_for_names)
species_names = [
name.strip()
for name in species_list_response.split('\n')
if name.strip()
]
species_names_to_verify = species_names[:100]
for i, species_name in enumerate(species_names_to_verify):
verification_prompt = (
f"Is '{species_name}' a real reptile species and is this it's correct scientific name?"
"Respond with a JSON object containing 'is_reptile' (boolean) and 'explanation' (string). "
"Example: {'is_reptile': true, 'explanation': 'Alligator (Alligator mississippiensis) is a large crocodilian reptile.'}"
)
try:
verification_response = judge.prompt(verification_prompt, schema=ReptileVerification)
if (
bm.assertions.assert_true(
verification_response.is_reptile,
expectation=f"'{species_name}' should be a real reptile species' scientific name. Explanation: {verification_response.explanation}"
)
): count = count + 1
except Exception as e:
bm.assertions.assert_true(
False,
expectation=f"Failed to verify '{species_name}' due to parsing error or LLM issue: {e}"
)
bm.assertions.assert_true(count == 100)
結果はこのようなビューで確認することができます。
このように、汎用ベンチマーク(MMLUなど)には載っていない、ニッチなタスクを解く最適なモデルを見つけることができます。
このマシンリソースの利用枠として、 AI Quota を1日10米ドル分使うことができるというわけです。
おまけ
無料の LLM 利用枠を使い、外部の自作アプリなどから API として呼び出すプロトタイプを紹介している動画がありました。
Kaggle のノートブック上で FastAPI をバックグラウンド起動し、Gradio のトンネリング機能を使って一時的なパブリック URL を発行し、外部からOpenAI互換の形式で、Kaggle の AI Quota を活用しています





