teai.ioのAnthropic/OpenAI互換APIを使えば、Claude CodeやOpenCodeで安価なモデルを使い、日々のコーディングタスクを1タスクあたり0.03円〜0.5円で回せることを実測。価格改定後のリアルなコスト比較。
結論から: Claude Code の向き先を https://api.teai.io/v1/messages に変えるだけで、Kimi K3 や DeepSeek V4 Pro がそのまま Claude Code として動き、日々のコーディングタスクが 1タスクあたり 0.03円〜0.5円 で回せた。OpenAI 互換エンドポイント(v1/chat/completions)は OpenCode や素の Python から使え、UI生成1本あたり 最安 0.03円 から。価格は2026-07-31に「上流実費+5%」へ全面改定済み(それまでは安いモデルほど実効2〜37倍の手数料になっていた)。2026-08-01 時点の実測ログつき。
| 実験 | タスク | 合格条件 | 最安の合格ライン | 改定後コスト |
|---|---|---|---|---|
| ① Claude Code 互換 | Python 営業日計算関数(機械採点7ケース) | 全テスト PASS | deepseek/deepseek-v4-pro | $0.00023(≈0.03円) |
| ② OpenCode/直叩き | 「今夜なに食べる?」1画面HTML生成 | doctype始まりの動くHTML | google/gemma-3-27b-it | $0.00021(≈0.03円) |
| ③ 全モデルスイープ | 日本語ビジネス常識6問 | 6/6 満点 | 満点は50モデルが達成 | 満点組最速 8.5s |
| ④ 複数ファイルの実バグ修正 | 3ファイル・2種類の実バグ(言語の落とし穴+仕様の読み落とし) | 7チェック全PASS | openai/gpt-5.4-nano | $0.00090(≈0.14円) |
※ 円換算は $1=150円。実測トークン数 × 改定後の単価(実費+5%込)で再計算。トークン数は実 usage。
teai.io は 95+ モデルを1つの API キーで、Anthropic 互換(/v1/messages)と OpenAI 互換(/v1/chat/completions)の両方を出している。つまり:
ANTHROPIC_BASE_URL=https://api.teai.io/v1 を指すだけで中身のモデルが差し替わるbase_url を https://api.teai.io/v1 に変えるだけさらに2026-07-31の価格改定で、クレジット消費レートは全モデル 上流原価+5% の自動導出になった。旧レートは整数切り上げのため、安いモデルほど実効2〜37倍の手数料を取られていた——つまり「安いモデルを使うほど得」になったのは今回が初めて。ならば実測で「どこまで安く落とせるか」を決めよう、という話。
「本当に安いモデルで日常タスクが回るのか?」を、正解が機械検証できるタスクで測った。感想戦ではなく assert です。
Claude Code が普段やる種類の仕事として、「営業日を計算する Python 関数」を書かせた。テストコード(金→月またぎ、土日開始、n=0、負数で ValueError など7ケース)はモデルに見せず、生成コードを subprocess で実際に実行して採点。
結果(2026-08-01 実測、合格=全テストPASS、コストは改定後価格で再計算):
| モデル | 判定 | レイテンシ | コスト(USD) | 円換算 |
|---|---|---|---|---|
| deepseek/deepseek-v4-pro | ✅ PASS | 23.0s | $0.00023 | 0.03円 |
| openai/gpt-5.4-nano | ✅ PASS | 5.4s | $0.00072 | 0.11円 |
| claude-haiku-4-5 | ✅ PASS | 2.1s | $0.00144 | 0.22円 |
| z-ai/glm-5.2 | ✅ PASS | 15.3s | $0.00225 | 0.34円 |
| moonshotai/kimi-k3 | ✅ PASS | 5.4s | $0.00319 | 0.48円 |
| x-ai/grok-4.5 | ✅ PASS | 9.2s | $0.00511 | 0.77円 |
| claude-sonnet-5 | ✅ PASS | 5.8s | $0.00721 | 1.08円 |
| openai/gpt-5.6-sol | ✅ PASS | 7.7s | $0.01389 | 2.08円 |
| google/gemma-3-27b-it | ❌ FAIL | 7.5s | $0.00004 | 0.006円 |
読みどころ:
プロダクトデザイナー兼実装者として「迷いを終わらせる1画面サービス(外部CDN禁止・スマホ375px・オフライン動作)」を単一HTMLで出させる、かなり実戦寄りのお題。同一ブリーフで14モデルに投げた。
成功 14/14、コストは改定後価格:
| モデル | コスト | 円換算 | 時間 | サイズ |
|---|---|---|---|---|
| google/gemma-3-27b-it | $0.00021 | 0.03円 | 23.0s | 2.0KB |
| deepseek/deepseek-v4-pro | $0.00206 | 0.31円 | 39.8s | 2.8KB |
| z-ai/glm-5.2 | $0.00324 | 0.49円 | 36.9s | 2.5KB |
| x-ai/grok-4.5 | $0.00473 | 0.71円 | 59.1s | 2.1KB |
| claude-sonnet-5 | $0.00986 | 1.48円 | 79.4s | 1.9KB |
| qwen/qwen3.5-397b-a17b | $0.01014 | 1.52円 | 25.1s | 9.7KB |
| openai/gpt-5.4-nano | $0.01059 | 1.59円 | 46.9s | 19.5KB |
| sakana/fugu-ultra | $0.01408 | 2.11円 | 21.0s | 1.3KB |
| mistralai/mistral-large | $0.01501 | 2.25円 | 35.3s | 7.1KB |
| openai/gpt-5.6-sol | $0.01799 | 2.70円 | 62.8s | 1.7KB |
| claude-haiku-4-5 | $0.01888 | 2.83円 | 18.1s | 7.4KB |
| moonshotai/kimi-k3 | $0.03380 | 5.07円 | 43.9s | 5.1KB |
| claude-fable-5 | $0.03748 | 5.62円 | 92.1s | 2.1KB |
| google/gemini-3.1-pro-preview | $0.06223 | 9.33円 | 58.1s | 7.2KB |
UI 1本作って 0.3〜5.6円。GPT-5.4-nano は 19.5KB も書いて 1.6円(出力単価が安いと長い生成ほど効く)。Haiku が最速かつ中位の出来で「仕事で回すならここ」という結果に。初回計測(2026-08-01)は grok-4.5・claude-sonnet-5・claude-fable-5・gpt-5.6-sol の4件が上流502で失敗し10/14だった。2026-08-05 に同条件で再実行したところ4件とも成功したため、上表は再実行後の値(14/14)。502は一時的な上流障害で、モデルの実力差ではなかった。
敬語のウチソト・営業日計算・全角半角・多重否定・助数詞・大字(だいじ)の6問を、teai 経由で叩ける全モデル(271系統・360ラン)に1回ずつ出した。
「日本語で仕事をするならモデル選びは実測しないと危ない」というのがスイープの素直な教訓。teai はモデル差し替えが1行なので、このスイープ自体も並列で数分で終わる。
実験①は「新規に1関数を書く」だった。ここでは一段階複雑にして、既存の3ファイル・約60行(在庫管理の小さなアプリ)を読ませ、報告された2件の不具合を直させた。性質の違う2種類のバグを混ぜてある:
add_item(..., tags=[]) のmutable default引数。タグを省略して複数の商品を登録すると、あとから片方につけたタグがもう片方にも紛れ込むprocess_order() のdocstringには「在庫不足ならValueErrorを投げ、注文全体をキャンセルする(atomic)」と明記されているのに、実装はそれを満たしていない(在庫不足でも例外を投げず、足りていた商品だけ先に減ってしまう)採点は7項目、実際にコードを実行して判定(部分点あり)。Claude Code 互換の /v1/messages 経由、採点コードはモデルに見せていない。
結果(2026-08-05 実測、コストは改定後価格):
| モデル | 判定 | チェック | レイテンシ | コスト | 円換算 |
|---|---|---|---|---|---|
| google/gemma-3-27b-it | ⚠️ 部分合格 | 6/7 | 9.1s | $0.00020 | 0.03円 |
| openai/gpt-5.4-nano | ✅ PASS | 7/7 | 5.3s | $0.00090 | 0.14円 |
| deepseek/deepseek-v4-pro | ✅ PASS | 7/7 | 58.5s | $0.00156 | 0.23円 |
| qwen/qwen3.5-397b-a17b | ✅ PASS | 7/7 | 15.4s | $0.00172 | 0.26円 |
| z-ai/glm-5.2 | ✅ PASS | 7/7 | 6.0s | $0.00394 | 0.59円 |
| claude-haiku-4-5 | ✅ PASS | 7/7 | 5.3s | $0.00490 | 0.74円 |
| x-ai/grok-4.5 | ✅ PASS | 7/7 | 14.0s | $0.00798 | 1.20円 |
| moonshotai/kimi-k3 | ✅ PASS | 7/7 | 16.4s | $0.01164 | 1.75円 |
| claude-sonnet-5 | ✅ PASS | 7/7 | 9.8s | $0.01714 | 2.57円 |
| openai/gpt-5.6-sol | ✅ PASS | 7/7 | 18.7s | $0.03089 | 4.63円 |
読みどころ:
Gemma(部分合格) — ロールバックのつもりが、未反映の変更を減算してしまっている:
GPT-5.4-nano(完全合格) — 検証と反映を分けるだけで済んだ:
実験①のクラスのタスク(小〜中規模のコード生成+検証)を1日100回回すと仮定(改定後価格):
| 使い方 | 1タスク | 1日(100回) | 月(20日) |
|---|---|---|---|
| 全部 Sonnet 5 | 1.08円 | 108円 | 約2,160円 |
| 全部 Kimi K3 | 0.48円 | 48円 | 約960円 |
| 全部 GLM 5.2 | 0.34円 | 34円 | 約680円 |
| 簡単なのは DeepSeek V4 Pro / nano に振り分け | 0.03〜0.11円 | 3〜11円 | 約70〜220円 |
難しい設計・根深いバグだけ上位モデル、日常は合格実績のある安いモデル——という振り分けが base_url 1行でできるのが teai.io の実利。「実費+5%」への改定で、安いモデルを選ぶ判断がそのまま原価に効くようになった(旧レートでは安いモデルほど手数料で潰れていた)。品質は「感覚」ではなく今回のように機械採点で決めれば、安くしても破綻しない。
# Claude Code (Anthropic compatible)
export ANTHROPIC_BASE_URL=https://api.teai.io/v1
export ANTHROPIC_API_KEY=<teai key>
# Then just swap the model (deepseek/deepseek-v4-pro, z-ai/glm-5.2, etc.)
# OpenCode / custom scripts (OpenAI compatible)
base_url = "https://api.teai.io/v1" # that's it
計測スクリプトは te-bakeoff/ に全て残してある(bake.py / claudecode_compat.py / sweep_all.py / task4_fixbugs.py)。TEAI_API_KEY を入れれば同じ実験がそのまま回る。