掘り出し物LLMを、
数値で見つける。

OpenRouter上のマイナー寄りモデルを、日本語タスクで継続ベンチマーク。 スコア・コスト・速度を可視化して、本命と掘り出し物をデータで比較できます。

検証済みモデル
5
ベンチタスク
21
実行ラン
162
累計コスト
$0.01

📅 最終更新: 2026-06-25 (DeepSeek: DeepSeek V4 Flash) · judge不一致 12%

🏆 性能ランキング

日本語チャット性能とエージェントコーディング性能を分けて表示

💬 チャット

データがありません

🛠 エージェント

データがありません

🛡 信頼性 & 速度ランキング

スコアだけでなく「安定して動くか・速いか」で並べた実用観点のランキング

# モデル 信頼性 成功率 速度 平均
レスポンス
p95 ラン数
1 openrouter/owl-alpha A 100% ⏱️ 中速 - - 42
2 google/gemma-4-31b-it:free A 100% ⏱️ 中速 - - 42
3 openai/gpt-oss-120b:free B 100% ⏱️ 中速 - - 38
4 deepseek/deepseek-v4-flash B 100% ⏱️ 中速 - - 40

💰 コストパフォ散布図

横軸: 累計コスト($) / 縦軸: スコア。右上のモデルが「安くて高性能」

💎 コスト効率ランキング (スコア/$)

同じ1ドルで何点取れるか。無料モデルは無限大扱い

データがありません

📝 最新の検証記事

note / X での発信は /publications にまとめてあります。