テックベンチ TECHBENCH
メニュー

AI翻訳はどれが正確?無料でも十分?ChatGPT・Claude・Gemini・DeepL・Google翻訳を同じ20文で実測比較【2026年7月版】

ChatGPT・Claude・Gemini・DeepL・Google翻訳・みらい翻訳など10の翻訳環境に完全に同じ日英20文を訳させ、出どころを伏せたブラインドAI評価で採点した。無料版と有料版の差、翻訳専用ツールと生成AIの差も実測。結論: 日常の翻訳なら無料で十分。

検証日: 公開: 最終更新:

結論: 翻訳品質の首位はChatGPT系とClaudeがAI評価93で同点。 上位のAIチャットはほぼ横並びだった。

そしてChatGPTは無料版でも91。有料版(92〜93)との差はわずかで、日常の翻訳なら無料のAIチャットで十分というのが今回の実測の答えだ。定番のDeepL(85)・Google翻訳(81)は、今回の実測では生成AIに品質で逆転されている

実測結果まとめ(総合スコア順) 検証日: 2026年7月15日 / 同一テストデータで実測
順位 ツール 総合 AI評価日→英(chrF)英→日(chrF) 無料枠(実測) リンク
1 ChatGPT系(Codex CLI / gpt-5.6-sol) 94点(総合スコア) 93 79 60 Web版チャットに無料枠あり(検証はCLI経由のため無料枠の実測は未実施) ChatGPT系(Codex CLI / gpt-5.6-sol) を試す
2 Claude(Fable 5) 94点(総合スコア) 93 84 69 Web版チャットに無料枠あり(検証はCLI経由のため無料枠の実測は未実施) Claude(Fable 5) を試す
3 ChatGPT Plus(Web版) 93点(総合スコア) 92 76 60 有料プラン(検証時モデル: gpt-5.6-sol・推論high)
4 Claude(Web版・Opus 4.8) 93点(総合スコア) 92 75 66 有料プラン(検証時モデル: Opus 4.8・推論high、Maxプラン)
5 ChatGPT(Web無料版) 92点(総合スコア) 91 74 57 Web版無料(検証時モデル名は画面に非表示・2026-07-15時点)
6 Gemini(Web無料版) 89点(総合スコア) 88 74 49 Web版無料(検証時モデル: Gemini 3.5 Flash)
7 Claude(Sonnet 5) 87点(総合スコア) 85 72 60 Web版チャットに無料枠あり(検証はCLI経由のため無料枠の実測は未実施)
8 DeepL翻訳(無料Web版) 87点(総合スコア) 85 69 46 未ログイン1回1,500文字/無料登録で拡大(上限値は要実測確認)
9 Google翻訳 83点(総合スコア) 81 68 47 登録不要・無制限、1回5,000文字まで(公式ヘルプに記載)
10 お試しAI翻訳(みらい翻訳) 68点(総合スコア) 64 55 40 登録不要・無料、1回1,500文字(2026-07-15実測。公式ニュースの2,000文字から変更されている)

スコアの算出方法は検証方法を参照。表の数値は検証時点の実測値です。

検証条件

  • テストデータ: 自作の20文(日→英10文・英→日10文。ビジネス4/カジュアル3/専門3ずつ)。敬語・慣用句・主語省略・多義語など、翻訳の差が出やすい要素を意図的に含めた
  • AI評価(主指標): 文ごとに10の訳文を匿名ラベルに混ぜ、系統の異なる2つの審査AI(GPT系・Claude系)が「意味の正確さ・自然さ」を絶対評価。2審の平均を0〜100で表示。参照訳を使わないため、特定の文体に有利になる偏りが入らない
  • ※審査AIは被験系統(GPT系・Claude系)と同族のため完全に独立ではない。訳文の匿名化と2審平均で偏りを緩和している
  • chrF(参考指標): 参照訳との文字一致度。正しくても表現が独自だと低く出るため参考列とした
  • 総合スコア: AI評価90% + 処理速度10%(速度を計測できない手動検証の系統は満点帯扱い。全系統が満点帯のため順位に影響しない)
  • 再現性: 生成AIは出力が毎回変わるため、自動実行できる3系統は同一条件で3回実行して中央値を採用。スコアのブレは最大2点だった(参考指標chrF基準の総合での測定。詳細は各ツールの検証メモ)
  • 入力方法の違い: AIチャットは20文を一括で入力、みらい翻訳は1文ずつ、DeepL・Google翻訳は方向別に10文ずつ一括入力(各サービスの通常の使い方に合わせた。条件差として明記する)
  • 検証日: 2026年7月15日(DeepL・Google翻訳の実測とAI評価の実施は7月17日)。AIチャットのWeb版とDeepL・Google翻訳は運営者がブラウザで手動実行、みらい翻訳は当サイトの固定手順でブラウザ操作、CLI系は各社の公式CLI経由

詳細は検証方法の公開ページを参照。なお Bing翻訳・Papago・Weblio翻訳は、利用規約の制約または未確認のため今回の検証対象から除外した

各ツールの実測結果

#1

ChatGPT系(Codex CLI / gpt-5.6-sol)

94/100総合スコア94点
AI評価 93
日→英(chrF) 79
英→日(chrF) 60
処理時間 2.2秒

良かった点(実測より)

  • AI評価93。Claude(93)と同点首位
  • 同名モデルのWeb版Plus(AI評価92)とほぼ一致し、環境差が小さいことを実測確認
  • 3回実行して総合スコアのブレなし(chrF基準)

イマイチな点(実測より)

  • 検証はコーディング用CLI(Codex)経由で、一般的な利用形態ではない
  • 初回実行がツール起動エラーで失敗した(再実行で成功)
  • チャット形式のため翻訳専用UIより操作が多い

検証メモ:検証方法: Codex CLI(ChatGPT Plusプラン)で20項目を一括翻訳(44秒/20項目)。参照訳は実行役に非公開。Web版ChatGPTの無料枠とはモデル・挙動が異なる点に注意 同一条件で3回実行し、総合スコアは中央値のrunを採用(ブレ幅はraw.runs参照)。 総合スコアはAI評価(参照訳なしブラインド2審査員平均、data/eval参照)90%+速度10%。chrF列は参考指標。

#2

Claude(Fable 5)

94/100総合スコア94点
AI評価 93
日→英(chrF) 84
英→日(chrF) 69
処理時間 1.1秒

良かった点(実測より)

  • AI評価93で首位(ChatGPT系と同点。日→英93/英→日93)
  • 3回実行して総合スコアのブレなし(chrF基準79/79/79)
  • 敬語・婉曲表現のレジスター維持が安定(ビジネス文で崩れなし)

イマイチな点(実測より)

  • 翻訳専用ツールではないため、チャットに貼り付けて指示する手間がかかる
  • 検証はCLI(API)経由。Web版の無料プランで同じモデルが使えるかは未検証
  • 参考指標のchrF(参照訳との一致度)では英→日69と、表現が独自になる傾向

検証メモ:検証方法: Claude(Fable 5)の新規コンテキストで20項目を一括翻訳(22.8秒/20項目)。参照訳は実行役に非公開 同一条件で3回実行し、総合スコアは中央値のrunを採用(ブレ幅はraw.runs参照)。 総合スコアはAI評価(参照訳なしブラインド2審査員平均、data/eval参照)90%+速度10%。chrF列は参考指標。

#3

ChatGPT Plus(Web版)

93/100総合スコア93点
AI評価 92
日→英(chrF) 76
英→日(chrF) 60
処理時間 5秒

良かった点(実測より)

  • Web版で最高水準のAI評価92(検証時モデル: gpt-5.6-sol・推論high。Claude Opus 4.8と同点)
  • 使用モデルを明示的に選べる
  • 英→日のAI評価93は全系統トップタイ

イマイチな点(実測より)

  • 有料(ChatGPT Plus $20/月)
  • 無料版(AI評価91)との差は1点で、翻訳目的だけなら差額の価値は小さい
  • 処理時間は未計測(手動検証)

検証メモ:検証方法: Web版ChatGPT Plus(モデル: gpt-5.6-sol、推論high)にユーザーが手動で貼り付けて実行(2026-07-15、1回)。速度未計測のため速度点は満点帯で仮置き。CLI(Codex)と同名モデルのため環境差の比較対象 総合スコアはAI評価(参照訳なしブラインド2審査員平均、data/eval参照)90%+速度10%。chrF列は参考指標。

#4

Claude(Web版・Opus 4.8)

93/100総合スコア93点
AI評価 92
日→英(chrF) 75
英→日(chrF) 66
処理時間 5秒

良かった点(実測より)

  • AI評価92(検証時モデル: Opus 4.8・推論high)。Web版ではChatGPT Plusと同点の最高水準
  • 婉曲表現の訳し分け(見送らせていただきます→regret that we must decline)が的確

イマイチな点(実測より)

  • 有料プラン前提(検証はMaxプラン)
  • 処理時間は未計測(手動検証)
  • 翻訳専用ツールではないためチャット操作が必要

検証メモ:検証方法: Web版claude.ai(Maxプラン、モデル: Opus 4.8、推論high)にユーザーが手動で貼り付けて実行(2026-07-15、1回)。速度未計測のため速度点は満点帯で仮置き 総合スコアはAI評価(参照訳なしブラインド2審査員平均、data/eval参照)90%+速度10%。chrF列は参考指標。

#5

ChatGPT(Web無料版)

92/100総合スコア92点
AI評価 91
日→英(chrF) 74
英→日(chrF) 57
処理時間 5秒

良かった点(実測より)

  • 無料・未ログインでもAI評価91。有料Plus(92)との差は1点
  • 「とりあえずAI翻訳を試す」の入口として十分な品質

イマイチな点(実測より)

  • 使用モデル名が画面で確認できない(2026-07-15時点)ため、品質が予告なく変わっても気づけない
  • 参考指標のchrFは69で、表現のばらつきはある
  • 処理時間は未計測(手動検証)

検証メモ:検証方法: Web版ChatGPT(無料・未ログイン相当)にユーザーが手動で貼り付けて実行(2026-07-15、1回)。モデル名は画面に非表示。速度は未計測のため速度点は満点帯(5秒/項目)で仮置き。単発実行だが、同一手法のCLI3回測定でブレ幅最大2点(chrF基準)を確認済み 総合スコアはAI評価(参照訳なしブラインド2審査員平均、data/eval参照)90%+速度10%。chrF列は参考指標。

#6

Gemini(Web無料版)

89/100総合スコア89点
AI評価 88
日→英(chrF) 74
英→日(chrF) 49
処理時間 5秒

良かった点(実測より)

  • 無料でAI評価88。日→英90は有料勢に肉薄
  • 登録済みGoogleアカウントがあればすぐ使える

イマイチな点(実測より)

  • 英→日がAI評価86・chrF49と、日→英に比べ相対的に弱い
  • 検証時モデルは3.5 Flash(無料枠)。上位モデルは未検証
  • 処理時間は未計測(手動検証)

検証メモ:検証方法: Web版Gemini(無料)にユーザーが手動で貼り付けて実行(2026-07-15、1回)。速度は未計測のため速度点は満点帯(5秒/項目)で仮置き(全系統が満点帯のため順位に影響なし)。単発実行だが、同一手法のCLI3回測定でブレ幅最大2点(chrF基準)を確認済み 総合スコアはAI評価(参照訳なしブラインド2審査員平均、data/eval参照)90%+速度10%。chrF列は参考指標。

#7

Claude(Sonnet 5)

87/100総合スコア87点
AI評価 85
日→英(chrF) 72
英→日(chrF) 60
処理時間 1秒

良かった点(実測より)

  • AI評価85。日常用途には十分な品質
  • 応答が軽快(20文一括で約20秒)

イマイチな点(実測より)

  • 今回のAIチャット勢では最下位(AI評価85)
  • 1回目の実行で出力のJSON形式が崩れて自己修正した(形式指定の安定性に難)
  • 3回実行で最大2点のブレ(69/67/69、chrF基準)

検証メモ:検証方法: Claude(Sonnet 5)の新規コンテキストで20項目を一括翻訳(20.2秒/20項目)。1回目のJSON出力が崩れ自己修正した完全版を採点。参照訳は実行役に非公開 同一条件で3回実行し、総合スコアは中央値のrunを採用(ブレ幅はraw.runs参照)。 総合スコアはAI評価(参照訳なしブラインド2審査員平均、data/eval参照)90%+速度10%。chrF列は参考指標。

#8

DeepL翻訳(無料Web版)

87/100総合スコア87点
AI評価 85
日→英(chrF) 69
英→日(chrF) 46
処理時間 5秒

良かった点(実測より)

  • 日→英はAI評価91で、無料AIチャットと同等の品質
  • 翻訳ボックスに貼るだけで指示文が不要。専用ツールとして操作が最少
  • 訳文が簡潔で整っており、ビジネス文の日→英に強い

イマイチな点(実測より)

  • 英→日はAI評価80で、上位AIチャット(91〜93)と差がある
  • 未ログインは1回1,500文字まで
  • 無料版への機密・個人情報の入力は規約で禁止されている
  • コピー時に「Translated with DeepL.com (free version)」の帰属行が自動で付く(手動削除が必要)

検証メモ:検証方法: Web版DeepL(未ログイン・無料版)に運営者が方向別一括(10文ずつ空行区切り)で貼り付けて実行(2026-07-17、1回)。速度未計測のため速度点は満点帯で仮置き。コピー時に「Translated with DeepL.com (free version)」の帰属行が自動付与される(採点前に除去)。貼り付け単位の条件差は検証条件に明記 総合スコアはAI評価(参照訳なしブラインド2審査員平均、data/eval参照)90%+速度10%。chrF列は参考指標。

#9

Google翻訳

83/100総合スコア83点
AI評価 81
日→英(chrF) 68
英→日(chrF) 47
処理時間 5秒

良かった点(実測より)

  • 完全無料・登録不要で、1回5,000文字と今回の比較で最大の入力枠(公式ヘルプ記載)
  • 日→英はAI評価87と実用水準
  • ページを開いて貼るだけで指示文が不要

イマイチな点(実測より)

  • 英→日はAI評価76で、今回のWeb系サービスでは低め
  • Web版に品質を上げる有料プランがない
  • 慣用句や婉曲表現で直訳寄りになる傾向(参考chrF 47)

検証メモ:検証方法: Web版Google翻訳に運営者が方向別一括(10文ずつ空行区切り)で貼り付けて実行(2026-07-17、1回)。速度未計測のため速度点は満点帯で仮置き。AIチャットは20文一括・みらい翻訳は1文ずつと貼り付け単位が異なる点は検証条件に明記 総合スコアはAI評価(参照訳なしブラインド2審査員平均、data/eval参照)90%+速度10%。chrF列は参考指標。

#10

お試しAI翻訳(みらい翻訳)

68/100総合スコア68点
AI評価 64
日→英(chrF) 55
英→日(chrF) 40
処理時間 2.4秒
お試しAI翻訳(みらい翻訳) | AI評価検証: 2026年7月15日
お試しAI翻訳(みらい翻訳) | 日→英(chrF)検証: 2026年7月15日

画像はクリックで拡大できます

良かった点(実測より)

  • 登録不要でページを開いてすぐ翻訳できる(1文あたり平均2.4秒)
  • 慣用句の処理は健闘(broke→「お金がない」、it's on me→「おごり」と意味を正しく処理)
  • 日本発サービスでUIが完全日本語

イマイチな点(実測より)

  • AI評価64で、AIチャット勢(85〜93)と明確な差
  • 特に英→日が弱い(AI評価60)
  • 1回の上限は1,500文字(公式ニュースの2,000文字から縮小されていることを実測確認)
  • 利用規約で非商用目的に限定されている

検証メモ:検証方法: 公式Web UI(お試し版・登録不要)をブラウザで1項目ずつ操作。項目間4秒以上のインターバル。 総合スコアはAI評価(参照訳なしブラインド2審査員平均、data/eval参照)90%+速度10%。chrF列は参考指標。

用途別のおすすめ

  • お金をかけずに普段の翻訳を済ませたいChatGPT無料版(AI評価91)かGemini無料版(88)。有料版との差はわずか
  • 指示文を書かずに、貼るだけで翻訳したいDeepL。日→英はAI評価91と無料AIチャット並み。ただし英→日は80に下がる
  • 長い文章をまとめてGoogle翻訳。1回5,000文字と入力枠が最大。品質(81)より手軽さ重視の選択
  • 仕事の文書で品質を最優先有料のAIチャット(ChatGPT Plus / Claude)。ただし機密文書を貼る前に、所属組織のルールと各サービスのデータ取り扱いを確認すること

今回わかった注意点(公式情報にない実測の発見)

  1. DeepLとGoogle翻訳は「英→日」が弱い。DeepLは日→英91に対し英→日80、Google翻訳は87に対し76。英語の記事を日本語で読む用途ではAIチャットのほうが安心
  2. みらい翻訳(お試し版)の文字数上限は1,500文字。公式の過去発表では2,000文字だが、実際の画面は1,500文字だった(2026年7月15日実測)
  3. ChatGPT無料版は使用モデル名が画面に表示されない(2026年7月15日時点)。品質が変わっても利用者には分からない
  4. 同じモデルならWeb版とCLI版の差は小さい。同名モデル(gpt-5.6-sol。Web版は画面のモデル表示に基づく)で比較したところ、AI評価は93と92でほぼ一致した
  5. DeepLの訳文をコピーすると「Translated with DeepL.com (free version)」の一文が自動で付く。そのまま資料に貼ると事故のもと
  6. みらい翻訳は総合では差がついたが、慣用句の処理は健闘。「I’m broke」を「お金がない」、「It’s on me」を「おごり」と意味を正しく処理した

よくある質問

無料のAI翻訳で十分ですか?
今回の実測では、ChatGPT無料版のAI評価は91で、有料版の92〜93とほぼ差がありませんでした。日常のメール・文章の翻訳なら無料版で十分というのが実測に基づく結論です。
DeepLとChatGPT、どちらが正確ですか?
今回の実測ではChatGPT(無料版でもAI評価91)がDeepL(85)を上回りました。特に英→日はDeepLが80まで下がります。ただしDeepLは指示文なしで貼るだけという手軽さがあり、日→英に限れば91で無料AIチャット並みです。
Bing翻訳やPapagoは比較に入っていないのですか?
利用規約の制約(または規約が未確認)のため、当サイトの検証手順では今回対象外としました。検証できる形が整い次第追加します。
仕事の機密文書をAI翻訳に貼っても大丈夫ですか?
サービスごとにデータの取り扱いが異なります。例えばDeepL無料版は機密情報の入力自体が規約で禁止されており、みらい翻訳(お試し版)は入力テキストがサーバーに保存され品質改善に使われることが規約に明記されています。機密情報は所属組織のルールを確認してから使ってください。
AIの翻訳は毎回結果が変わるのでは?
変わりますが、20文の平均スコアで見ると影響はわずかです。自動実行できる3系統を同一条件で3回実行したところ、スコアのブレは最大2点でした(参考指標chrF基準の総合での測定)。
この結果はいつのものですか?
2026年7月15日〜17日の実測です。毎月同じ20文で再検証し、このページを更新します。