ベンチマーク

Claude Code / OpenCode に挿すだけ。
teai.io で「このクオリティで、この値段」を実測した

teai.ioのAnthropic/OpenAI互換APIを使えば、Claude CodeやOpenCodeで安価なモデルを使い、日々のコーディングタスクを1タスクあたり0.03円〜0.5円で回せることを実測。価格改定後のリアルなコスト比較。

実施日 2026-08-01
更新 2026-08-05(実験④追加・実験②を再計測)
バックエンド teai.io(api.teai.io)
タスク数 複数

結論から: Claude Code の向き先を https://api.teai.io/v1/messages に変えるだけで、Kimi K3 や DeepSeek V4 Pro がそのまま Claude Code として動き、日々のコーディングタスクが 1タスクあたり 0.03円〜0.5円 で回せた。OpenAI 互換エンドポイント(v1/chat/completions)は OpenCode や素の Python から使え、UI生成1本あたり 最安 0.03円 から。価格は2026-07-31に「上流実費+5%」へ全面改定済み(それまでは安いモデルほど実効2〜37倍の手数料になっていた)。2026-08-01 時点の実測ログつき。

TL;DR — 数字だけ見たい人向け

実験タスク合格条件最安の合格ライン改定後コスト
① Claude Code 互換Python 営業日計算関数(機械採点7ケース)全テスト PASSdeepseek/deepseek-v4-pro$0.00023(≈0.03円)
② OpenCode/直叩き「今夜なに食べる?」1画面HTML生成doctype始まりの動くHTMLgoogle/gemma-3-27b-it$0.00021(≈0.03円)
③ 全モデルスイープ日本語ビジネス常識6問6/6 満点満点は50モデルが達成満点組最速 8.5s
④ 複数ファイルの実バグ修正3ファイル・2種類の実バグ(言語の落とし穴+仕様の読み落とし)7チェック全PASSopenai/gpt-5.4-nano$0.00090(≈0.14円)

※ 円換算は $1=150円。実測トークン数 × 改定後の単価(実費+5%込)で再計算。トークン数は実 usage。

背景: 「高いモデル」信仰を、改定後の実価格で検証する

teai.io は 95+ モデルを1つの API キーで、Anthropic 互換(/v1/messages)と OpenAI 互換(/v1/chat/completions)の両方を出している。つまり:

さらに2026-07-31の価格改定で、クレジット消費レートは全モデル 上流原価+5% の自動導出になった。旧レートは整数切り上げのため、安いモデルほど実効2〜37倍の手数料を取られていた——つまり「安いモデルを使うほど得」になったのは今回が初めて。ならば実測で「どこまで安く落とせるか」を決めよう、という話。

「本当に安いモデルで日常タスクが回るのか?」を、正解が機械検証できるタスクで測った。感想戦ではなく assert です。

実験① Claude Code のまま中身だけ差し替え(Anthropic 互換)

Claude Code が普段やる種類の仕事として、「営業日を計算する Python 関数」を書かせた。テストコード(金→月またぎ、土日開始、n=0、負数で ValueError など7ケース)はモデルに見せず、生成コードを subprocess で実際に実行して採点。

結果(2026-08-01 実測、合格=全テストPASS、コストは改定後価格で再計算):

モデル判定レイテンシコスト(USD)円換算
deepseek/deepseek-v4-pro✅ PASS23.0s$0.000230.03円
openai/gpt-5.4-nano✅ PASS5.4s$0.000720.11円
claude-haiku-4-5✅ PASS2.1s$0.001440.22円
z-ai/glm-5.2✅ PASS15.3s$0.002250.34円
moonshotai/kimi-k3✅ PASS5.4s$0.003190.48円
x-ai/grok-4.5✅ PASS9.2s$0.005110.77円
claude-sonnet-5✅ PASS5.8s$0.007211.08円
openai/gpt-5.6-sol✅ PASS7.7s$0.013892.08円
google/gemma-3-27b-it❌ FAIL7.5s$0.000040.006円

読みどころ:

実験② 1画面サービスを丸ごと生成(OpenAI 互換 = OpenCode 経路)

プロダクトデザイナー兼実装者として「迷いを終わらせる1画面サービス(外部CDN禁止・スマホ375px・オフライン動作)」を単一HTMLで出させる、かなり実戦寄りのお題。同一ブリーフで14モデルに投げた。

成功 14/14、コストは改定後価格:

モデルコスト円換算時間サイズ
google/gemma-3-27b-it$0.000210.03円23.0s2.0KB
deepseek/deepseek-v4-pro$0.002060.31円39.8s2.8KB
z-ai/glm-5.2$0.003240.49円36.9s2.5KB
x-ai/grok-4.5$0.004730.71円59.1s2.1KB
claude-sonnet-5$0.009861.48円79.4s1.9KB
qwen/qwen3.5-397b-a17b$0.010141.52円25.1s9.7KB
openai/gpt-5.4-nano$0.010591.59円46.9s19.5KB
sakana/fugu-ultra$0.014082.11円21.0s1.3KB
mistralai/mistral-large$0.015012.25円35.3s7.1KB
openai/gpt-5.6-sol$0.017992.70円62.8s1.7KB
claude-haiku-4-5$0.018882.83円18.1s7.4KB
moonshotai/kimi-k3$0.033805.07円43.9s5.1KB
claude-fable-5$0.037485.62円92.1s2.1KB
google/gemini-3.1-pro-preview$0.062239.33円58.1s7.2KB

UI 1本作って 0.3〜5.6円。GPT-5.4-nano は 19.5KB も書いて 1.6円(出力単価が安いと長い生成ほど効く)。Haiku が最速かつ中位の出来で「仕事で回すならここ」という結果に。初回計測(2026-08-01)は grok-4.5・claude-sonnet-5・claude-fable-5・gpt-5.6-sol の4件が上流502で失敗し10/14だった。2026-08-05 に同条件で再実行したところ4件とも成功したため、上表は再実行後の値(14/14)。502は一時的な上流障害で、モデルの実力差ではなかった。

実験③ 95+モデル全員に同じ日本語テスト(スイープ)

敬語のウチソト・営業日計算・全角半角・多重否定・助数詞・大字(だいじ)の6問を、teai 経由で叩ける全モデル(271系統・360ラン)に1回ずつ出した。

日本語で仕事をするならモデル選びは実測しないと危ない」というのがスイープの素直な教訓。teai はモデル差し替えが1行なので、このスイープ自体も並列で数分で終わる。

実験④ 実際のバグ修正(複数ファイル・仕様違反+言語の落とし穴)

実験①は「新規に1関数を書く」だった。ここでは一段階複雑にして、既存の3ファイル・約60行(在庫管理の小さなアプリ)を読ませ、報告された2件の不具合を直させた。性質の違う2種類のバグを混ぜてある:

採点は7項目、実際にコードを実行して判定(部分点あり)。Claude Code 互換の /v1/messages 経由、採点コードはモデルに見せていない。

結果(2026-08-05 実測、コストは改定後価格):

モデル判定チェックレイテンシコスト円換算
google/gemma-3-27b-it⚠️ 部分合格6/79.1s$0.000200.03円
openai/gpt-5.4-nano✅ PASS7/75.3s$0.000900.14円
deepseek/deepseek-v4-pro✅ PASS7/758.5s$0.001560.23円
qwen/qwen3.5-397b-a17b✅ PASS7/715.4s$0.001720.26円
z-ai/glm-5.2✅ PASS7/76.0s$0.003940.59円
claude-haiku-4-5✅ PASS7/75.3s$0.004900.74円
x-ai/grok-4.5✅ PASS7/714.0s$0.007981.20円
moonshotai/kimi-k3✅ PASS7/716.4s$0.011641.75円
claude-sonnet-5✅ PASS7/79.8s$0.017142.57円
openai/gpt-5.6-sol✅ PASS7/718.7s$0.030894.63円

読みどころ:

Gemma(部分合格) — ロールバックのつもりが、未反映の変更を減算してしまっている:

if not item or item["qty"] < qty: for n, change in temp_changes.items(): inventory.items[n]["qty"] += change # ← まだ減らしてないのに、ここで減算される raise ValueError(...) temp_changes[name] = -qty # 在庫はまだ変更していない(記録だけ)

GPT-5.4-nano(完全合格) — 検証と反映を分けるだけで済んだ:

# まず検証(ここでは在庫を減らさない) for name, qty in order_items: if not item or item["qty"] < qty: raise ValueError(...) # 検証後に一括で反映 for name, qty in order_items: item["qty"] -= qty

まとめ: いくら浮くのか

実験①のクラスのタスク(小〜中規模のコード生成+検証)を1日100回回すと仮定(改定後価格):

使い方1タスク1日(100回)月(20日)
全部 Sonnet 51.08円108円約2,160円
全部 Kimi K30.48円48円約960円
全部 GLM 5.20.34円34円約680円
簡単なのは DeepSeek V4 Pro / nano に振り分け0.03〜0.11円3〜11円約70〜220円

難しい設計・根深いバグだけ上位モデル、日常は合格実績のある安いモデル——という振り分けが base_url 1行でできるのが teai.io の実利。「実費+5%」への改定で、安いモデルを選ぶ判断がそのまま原価に効くようになった(旧レートでは安いモデルほど手数料で潰れていた)。品質は「感覚」ではなく今回のように機械採点で決めれば、安くしても破綻しない。

再現手順(3分)

# Claude Code (Anthropic compatible)
export ANTHROPIC_BASE_URL=https://api.teai.io/v1
export ANTHROPIC_API_KEY=<teai key>
# Then just swap the model (deepseek/deepseek-v4-pro, z-ai/glm-5.2, etc.)

# OpenCode / custom scripts (OpenAI compatible)
base_url = "https://api.teai.io/v1"  # that's it

計測スクリプトは te-bakeoff/ に全て残してある(bake.py / claudecode_compat.py / sweep_all.py / task4_fixbugs.py)。TEAI_API_KEY を入れれば同じ実験がそのまま回る。

計測日: 2026-08-01(実験①〜③)・2026-08-05(実験④、および実験②の再計測) / 価格は2026-07-31改定後のテーブル(上流原価+5%)で再計算。

teai.ioを無料で試す

クレジットカード不要・登録だけで100クレジット。Qwen3.7 Flash は入力$0.03/100万tokenの激安。

無料で始める 他の記事を見る

関連記事