AI翻訳はどれが正確?無料でも十分?ChatGPT・Claude・Gemini・DeepL・Google翻訳を同じ20文で実測比較【2026年7月版】
ChatGPT・Claude・Gemini・DeepL・Google翻訳・みらい翻訳など10の翻訳環境に完全に同じ日英20文を訳させ、出どころを伏せたブラインドAI評価で採点した。無料版と有料版の差、翻訳専用ツールと生成AIの差も実測。結論: 日常の翻訳なら無料で十分。
結論: 翻訳品質の首位はChatGPT系とClaudeがAI評価93で同点。 上位のAIチャットはほぼ横並びだった。
そしてChatGPTは無料版でも91。有料版(92〜93)との差はわずかで、日常の翻訳なら無料のAIチャットで十分というのが今回の実測の答えだ。定番のDeepL(85)・Google翻訳(81)は、今回の実測では生成AIに品質で逆転されている。
| 順位 | ツール | 総合 | AI評価 | 日→英(chrF) | 英→日(chrF) | 無料枠(実測) | リンク |
|---|---|---|---|---|---|---|---|
| 1 | ChatGPT系(Codex CLI / gpt-5.6-sol) | 94点(総合スコア) | 93 | 79 | 60 | Web版チャットに無料枠あり(検証はCLI経由のため無料枠の実測は未実施) | ChatGPT系(Codex CLI / gpt-5.6-sol) を試す |
| 2 | Claude(Fable 5) | 94点(総合スコア) | 93 | 84 | 69 | Web版チャットに無料枠あり(検証はCLI経由のため無料枠の実測は未実施) | Claude(Fable 5) を試す |
| 3 | ChatGPT Plus(Web版) | 93点(総合スコア) | 92 | 76 | 60 | 有料プラン(検証時モデル: gpt-5.6-sol・推論high) | |
| 4 | Claude(Web版・Opus 4.8) | 93点(総合スコア) | 92 | 75 | 66 | 有料プラン(検証時モデル: Opus 4.8・推論high、Maxプラン) | |
| 5 | ChatGPT(Web無料版) | 92点(総合スコア) | 91 | 74 | 57 | Web版無料(検証時モデル名は画面に非表示・2026-07-15時点) | |
| 6 | Gemini(Web無料版) | 89点(総合スコア) | 88 | 74 | 49 | Web版無料(検証時モデル: Gemini 3.5 Flash) | |
| 7 | Claude(Sonnet 5) | 87点(総合スコア) | 85 | 72 | 60 | Web版チャットに無料枠あり(検証はCLI経由のため無料枠の実測は未実施) | |
| 8 | DeepL翻訳(無料Web版) | 87点(総合スコア) | 85 | 69 | 46 | 未ログイン1回1,500文字/無料登録で拡大(上限値は要実測確認) | |
| 9 | Google翻訳 | 83点(総合スコア) | 81 | 68 | 47 | 登録不要・無制限、1回5,000文字まで(公式ヘルプに記載) | |
| 10 | お試しAI翻訳(みらい翻訳) | 68点(総合スコア) | 64 | 55 | 40 | 登録不要・無料、1回1,500文字(2026-07-15実測。公式ニュースの2,000文字から変更されている) |
スコアの算出方法は検証方法を参照。表の数値は検証時点の実測値です。
検証条件
- テストデータ: 自作の20文(日→英10文・英→日10文。ビジネス4/カジュアル3/専門3ずつ)。敬語・慣用句・主語省略・多義語など、翻訳の差が出やすい要素を意図的に含めた
- AI評価(主指標): 文ごとに10の訳文を匿名ラベルに混ぜ、系統の異なる2つの審査AI(GPT系・Claude系)が「意味の正確さ・自然さ」を絶対評価。2審の平均を0〜100で表示。参照訳を使わないため、特定の文体に有利になる偏りが入らない
- ※審査AIは被験系統(GPT系・Claude系)と同族のため完全に独立ではない。訳文の匿名化と2審平均で偏りを緩和している
- chrF(参考指標): 参照訳との文字一致度。正しくても表現が独自だと低く出るため参考列とした
- 総合スコア: AI評価90% + 処理速度10%(速度を計測できない手動検証の系統は満点帯扱い。全系統が満点帯のため順位に影響しない)
- 再現性: 生成AIは出力が毎回変わるため、自動実行できる3系統は同一条件で3回実行して中央値を採用。スコアのブレは最大2点だった(参考指標chrF基準の総合での測定。詳細は各ツールの検証メモ)
- 入力方法の違い: AIチャットは20文を一括で入力、みらい翻訳は1文ずつ、DeepL・Google翻訳は方向別に10文ずつ一括入力(各サービスの通常の使い方に合わせた。条件差として明記する)
- 検証日: 2026年7月15日(DeepL・Google翻訳の実測とAI評価の実施は7月17日)。AIチャットのWeb版とDeepL・Google翻訳は運営者がブラウザで手動実行、みらい翻訳は当サイトの固定手順でブラウザ操作、CLI系は各社の公式CLI経由
詳細は検証方法の公開ページを参照。なお Bing翻訳・Papago・Weblio翻訳は、利用規約の制約または未確認のため今回の検証対象から除外した。
各ツールの実測結果
ChatGPT系(Codex CLI / gpt-5.6-sol)
良かった点(実測より)
- AI評価93。Claude(93)と同点首位
- 同名モデルのWeb版Plus(AI評価92)とほぼ一致し、環境差が小さいことを実測確認
- 3回実行して総合スコアのブレなし(chrF基準)
イマイチな点(実測より)
- 検証はコーディング用CLI(Codex)経由で、一般的な利用形態ではない
- 初回実行がツール起動エラーで失敗した(再実行で成功)
- チャット形式のため翻訳専用UIより操作が多い
検証メモ:検証方法: Codex CLI(ChatGPT Plusプラン)で20項目を一括翻訳(44秒/20項目)。参照訳は実行役に非公開。Web版ChatGPTの無料枠とはモデル・挙動が異なる点に注意 同一条件で3回実行し、総合スコアは中央値のrunを採用(ブレ幅はraw.runs参照)。 総合スコアはAI評価(参照訳なしブラインド2審査員平均、data/eval参照)90%+速度10%。chrF列は参考指標。
Claude(Fable 5)
良かった点(実測より)
- AI評価93で首位(ChatGPT系と同点。日→英93/英→日93)
- 3回実行して総合スコアのブレなし(chrF基準79/79/79)
- 敬語・婉曲表現のレジスター維持が安定(ビジネス文で崩れなし)
イマイチな点(実測より)
- 翻訳専用ツールではないため、チャットに貼り付けて指示する手間がかかる
- 検証はCLI(API)経由。Web版の無料プランで同じモデルが使えるかは未検証
- 参考指標のchrF(参照訳との一致度)では英→日69と、表現が独自になる傾向
検証メモ:検証方法: Claude(Fable 5)の新規コンテキストで20項目を一括翻訳(22.8秒/20項目)。参照訳は実行役に非公開 同一条件で3回実行し、総合スコアは中央値のrunを採用(ブレ幅はraw.runs参照)。 総合スコアはAI評価(参照訳なしブラインド2審査員平均、data/eval参照)90%+速度10%。chrF列は参考指標。
ChatGPT Plus(Web版)
良かった点(実測より)
- Web版で最高水準のAI評価92(検証時モデル: gpt-5.6-sol・推論high。Claude Opus 4.8と同点)
- 使用モデルを明示的に選べる
- 英→日のAI評価93は全系統トップタイ
イマイチな点(実測より)
- 有料(ChatGPT Plus $20/月)
- 無料版(AI評価91)との差は1点で、翻訳目的だけなら差額の価値は小さい
- 処理時間は未計測(手動検証)
検証メモ:検証方法: Web版ChatGPT Plus(モデル: gpt-5.6-sol、推論high)にユーザーが手動で貼り付けて実行(2026-07-15、1回)。速度未計測のため速度点は満点帯で仮置き。CLI(Codex)と同名モデルのため環境差の比較対象 総合スコアはAI評価(参照訳なしブラインド2審査員平均、data/eval参照)90%+速度10%。chrF列は参考指標。
Claude(Web版・Opus 4.8)
良かった点(実測より)
- AI評価92(検証時モデル: Opus 4.8・推論high)。Web版ではChatGPT Plusと同点の最高水準
- 婉曲表現の訳し分け(見送らせていただきます→regret that we must decline)が的確
イマイチな点(実測より)
- 有料プラン前提(検証はMaxプラン)
- 処理時間は未計測(手動検証)
- 翻訳専用ツールではないためチャット操作が必要
検証メモ:検証方法: Web版claude.ai(Maxプラン、モデル: Opus 4.8、推論high)にユーザーが手動で貼り付けて実行(2026-07-15、1回)。速度未計測のため速度点は満点帯で仮置き 総合スコアはAI評価(参照訳なしブラインド2審査員平均、data/eval参照)90%+速度10%。chrF列は参考指標。
ChatGPT(Web無料版)
良かった点(実測より)
- 無料・未ログインでもAI評価91。有料Plus(92)との差は1点
- 「とりあえずAI翻訳を試す」の入口として十分な品質
イマイチな点(実測より)
- 使用モデル名が画面で確認できない(2026-07-15時点)ため、品質が予告なく変わっても気づけない
- 参考指標のchrFは69で、表現のばらつきはある
- 処理時間は未計測(手動検証)
検証メモ:検証方法: Web版ChatGPT(無料・未ログイン相当)にユーザーが手動で貼り付けて実行(2026-07-15、1回)。モデル名は画面に非表示。速度は未計測のため速度点は満点帯(5秒/項目)で仮置き。単発実行だが、同一手法のCLI3回測定でブレ幅最大2点(chrF基準)を確認済み 総合スコアはAI評価(参照訳なしブラインド2審査員平均、data/eval参照)90%+速度10%。chrF列は参考指標。
Gemini(Web無料版)
良かった点(実測より)
- 無料でAI評価88。日→英90は有料勢に肉薄
- 登録済みGoogleアカウントがあればすぐ使える
イマイチな点(実測より)
- 英→日がAI評価86・chrF49と、日→英に比べ相対的に弱い
- 検証時モデルは3.5 Flash(無料枠)。上位モデルは未検証
- 処理時間は未計測(手動検証)
検証メモ:検証方法: Web版Gemini(無料)にユーザーが手動で貼り付けて実行(2026-07-15、1回)。速度は未計測のため速度点は満点帯(5秒/項目)で仮置き(全系統が満点帯のため順位に影響なし)。単発実行だが、同一手法のCLI3回測定でブレ幅最大2点(chrF基準)を確認済み 総合スコアはAI評価(参照訳なしブラインド2審査員平均、data/eval参照)90%+速度10%。chrF列は参考指標。
Claude(Sonnet 5)
良かった点(実測より)
- AI評価85。日常用途には十分な品質
- 応答が軽快(20文一括で約20秒)
イマイチな点(実測より)
- 今回のAIチャット勢では最下位(AI評価85)
- 1回目の実行で出力のJSON形式が崩れて自己修正した(形式指定の安定性に難)
- 3回実行で最大2点のブレ(69/67/69、chrF基準)
検証メモ:検証方法: Claude(Sonnet 5)の新規コンテキストで20項目を一括翻訳(20.2秒/20項目)。1回目のJSON出力が崩れ自己修正した完全版を採点。参照訳は実行役に非公開 同一条件で3回実行し、総合スコアは中央値のrunを採用(ブレ幅はraw.runs参照)。 総合スコアはAI評価(参照訳なしブラインド2審査員平均、data/eval参照)90%+速度10%。chrF列は参考指標。
DeepL翻訳(無料Web版)
良かった点(実測より)
- 日→英はAI評価91で、無料AIチャットと同等の品質
- 翻訳ボックスに貼るだけで指示文が不要。専用ツールとして操作が最少
- 訳文が簡潔で整っており、ビジネス文の日→英に強い
イマイチな点(実測より)
- 英→日はAI評価80で、上位AIチャット(91〜93)と差がある
- 未ログインは1回1,500文字まで
- 無料版への機密・個人情報の入力は規約で禁止されている
- コピー時に「Translated with DeepL.com (free version)」の帰属行が自動で付く(手動削除が必要)
検証メモ:検証方法: Web版DeepL(未ログイン・無料版)に運営者が方向別一括(10文ずつ空行区切り)で貼り付けて実行(2026-07-17、1回)。速度未計測のため速度点は満点帯で仮置き。コピー時に「Translated with DeepL.com (free version)」の帰属行が自動付与される(採点前に除去)。貼り付け単位の条件差は検証条件に明記 総合スコアはAI評価(参照訳なしブラインド2審査員平均、data/eval参照)90%+速度10%。chrF列は参考指標。
Google翻訳
良かった点(実測より)
- 完全無料・登録不要で、1回5,000文字と今回の比較で最大の入力枠(公式ヘルプ記載)
- 日→英はAI評価87と実用水準
- ページを開いて貼るだけで指示文が不要
イマイチな点(実測より)
- 英→日はAI評価76で、今回のWeb系サービスでは低め
- Web版に品質を上げる有料プランがない
- 慣用句や婉曲表現で直訳寄りになる傾向(参考chrF 47)
検証メモ:検証方法: Web版Google翻訳に運営者が方向別一括(10文ずつ空行区切り)で貼り付けて実行(2026-07-17、1回)。速度未計測のため速度点は満点帯で仮置き。AIチャットは20文一括・みらい翻訳は1文ずつと貼り付け単位が異なる点は検証条件に明記 総合スコアはAI評価(参照訳なしブラインド2審査員平均、data/eval参照)90%+速度10%。chrF列は参考指標。
お試しAI翻訳(みらい翻訳)
画像はクリックで拡大できます
良かった点(実測より)
- 登録不要でページを開いてすぐ翻訳できる(1文あたり平均2.4秒)
- 慣用句の処理は健闘(broke→「お金がない」、it's on me→「おごり」と意味を正しく処理)
- 日本発サービスでUIが完全日本語
イマイチな点(実測より)
- AI評価64で、AIチャット勢(85〜93)と明確な差
- 特に英→日が弱い(AI評価60)
- 1回の上限は1,500文字(公式ニュースの2,000文字から縮小されていることを実測確認)
- 利用規約で非商用目的に限定されている
検証メモ:検証方法: 公式Web UI(お試し版・登録不要)をブラウザで1項目ずつ操作。項目間4秒以上のインターバル。 総合スコアはAI評価(参照訳なしブラインド2審査員平均、data/eval参照)90%+速度10%。chrF列は参考指標。
用途別のおすすめ
- お金をかけずに普段の翻訳を済ませたい → ChatGPT無料版(AI評価91)かGemini無料版(88)。有料版との差はわずか
- 指示文を書かずに、貼るだけで翻訳したい → DeepL。日→英はAI評価91と無料AIチャット並み。ただし英→日は80に下がる
- 長い文章をまとめて → Google翻訳。1回5,000文字と入力枠が最大。品質(81)より手軽さ重視の選択
- 仕事の文書で品質を最優先 → 有料のAIチャット(ChatGPT Plus / Claude)。ただし機密文書を貼る前に、所属組織のルールと各サービスのデータ取り扱いを確認すること
今回わかった注意点(公式情報にない実測の発見)
- DeepLとGoogle翻訳は「英→日」が弱い。DeepLは日→英91に対し英→日80、Google翻訳は87に対し76。英語の記事を日本語で読む用途ではAIチャットのほうが安心
- みらい翻訳(お試し版)の文字数上限は1,500文字。公式の過去発表では2,000文字だが、実際の画面は1,500文字だった(2026年7月15日実測)
- ChatGPT無料版は使用モデル名が画面に表示されない(2026年7月15日時点)。品質が変わっても利用者には分からない
- 同じモデルならWeb版とCLI版の差は小さい。同名モデル(gpt-5.6-sol。Web版は画面のモデル表示に基づく)で比較したところ、AI評価は93と92でほぼ一致した
- DeepLの訳文をコピーすると「Translated with DeepL.com (free version)」の一文が自動で付く。そのまま資料に貼ると事故のもと
- みらい翻訳は総合では差がついたが、慣用句の処理は健闘。「I’m broke」を「お金がない」、「It’s on me」を「おごり」と意味を正しく処理した
よくある質問
- 無料のAI翻訳で十分ですか?
- 今回の実測では、ChatGPT無料版のAI評価は91で、有料版の92〜93とほぼ差がありませんでした。日常のメール・文章の翻訳なら無料版で十分というのが実測に基づく結論です。
- DeepLとChatGPT、どちらが正確ですか?
- 今回の実測ではChatGPT(無料版でもAI評価91)がDeepL(85)を上回りました。特に英→日はDeepLが80まで下がります。ただしDeepLは指示文なしで貼るだけという手軽さがあり、日→英に限れば91で無料AIチャット並みです。
- Bing翻訳やPapagoは比較に入っていないのですか?
- 利用規約の制約(または規約が未確認)のため、当サイトの検証手順では今回対象外としました。検証できる形が整い次第追加します。
- 仕事の機密文書をAI翻訳に貼っても大丈夫ですか?
- サービスごとにデータの取り扱いが異なります。例えばDeepL無料版は機密情報の入力自体が規約で禁止されており、みらい翻訳(お試し版)は入力テキストがサーバーに保存され品質改善に使われることが規約に明記されています。機密情報は所属組織のルールを確認してから使ってください。
- AIの翻訳は毎回結果が変わるのでは?
- 変わりますが、20文の平均スコアで見ると影響はわずかです。自動実行できる3系統を同一条件で3回実行したところ、スコアのブレは最大2点でした(参考指標chrF基準の総合での測定)。
- この結果はいつのものですか?
- 2026年7月15日〜17日の実測です。毎月同じ20文で再検証し、このページを更新します。