ElevenLabsは、感情表現を強めた音声合成モデル「Eleven v4」と、低遅延版の「Eleven v4 Turbo」を公開しました。日本語を含む90以上の言語に対応しており、日本の企業・学校では、ナレーション・教材音声・電話などの音声応答を作る方法を見直すきっかけになります。
この記事は、ElevenLabsが2026年9月28日に公開した公式発表をもとに、2026年10月3日時点の情報で書いています。
何が発表されたか
音声合成(テキストを読み上げ音声に変える技術。TTSとも呼ばれます)の新しいモデルが2つ公開されました。要点は次のとおりです。
- 新しいアーキテクチャの2モデル: 表現力を重視した「Eleven v4」と、エージェント(会話型AI)など低遅延の用途向けの「Eleven v4 Turbo」です
- 話し方の指示: 文章の口調・間・感情・文脈を読み取って話し方を変えます。[laughs] のような音声タグや自然な文章で、話し方や効果音を指定できます。従来モデルより指示に正確に従うとしています
- 複数話者の会話: 直前の発言を踏まえた自然なやり取りを生成し、話者ごとの声の特徴を保つとしています
- 多言語: 両モデルとも90以上の言語に対応します。公式ドキュメントの対応言語一覧には日本語が含まれています。ある言語で録った声が、別の言語をその言語らしいアクセントで話せます
- 声のクローン: 「Instant Voice Clone」は10秒の音声で声を高い忠実度で再現できるとしています。より高品質な「Professional Voice Clone(PVC)」にも対応します
- 提供先: ElevenAgents・ElevenCreative・ElevenAPIで提供が始まっています。無料アカウントで試せると案内されています

| 項目 | 内容 |
|---|---|
| 発表日 | 2026年9月28日 |
| 対応言語 | 90以上(日本語を含む) |
| 料金 | モデル別の料金は発表本文に書かれていません |
| キャンペーン | 発表ページの告知欄に「Creator+」で10月12日までクレジット3倍との案内があります |
なお、表現力の評価(Artificial Analysisのランキング1位、聞き比べで約75%が選んだ)や速さの数字は、ElevenLabsが2026年9月に示した条件での結果です。
日本の企業・学校でどう使えるか
業務・授業での使いどころ
ここからはTERRAISEの考えです。業務を「入力 → 処理 → 出力」に分けると、AIに任せる範囲が見えます。
- 研修・マニュアル動画のナレーション(人事・製造現場・営業企画) - 入力: 原稿と、話し方の指示(落ち着いて、要点は強調など) - 処理: Eleven v4で読み上げ音声を作る - 出力: 動画に載せるナレーション - 原稿を直せば音声を作り直せるため、録り直しの手間が減ることが考えられます。同じ声で他言語版を作る使い方もあります
- 問い合わせ窓口の音声応答(カスタマーサポート) - 入力: お客様の発話 - 処理: ElevenAgentsのエージェントが回答を考え、Eleven v4 Turboが話す - 出力: 音声での案内。難しい内容は担当者へ引き継ぐ - まずは営業時間の案内など、答えが決まっている質問から試すのがおすすめです
- 外国語のリスニング・会話教材(高校・大学の授業) - 入力: 話者ごとに分けた会話の台本 - 処理: 複数話者の会話として音声を生成 - 出力: 場面に合った会話音声の教材 - 教員が台本と発音を確かめてから授業で使う形が考えられます
始め方
一般的な進め方として、次の手順をおすすめします。
- 担当者が無料アカウントで試す: 機密を含まない社内原稿や教材の一節を使い、日本語の読み上げを聞き比べます
- 用途を1つに絞る: 「研修動画のナレーション」など1つを選び、入力・処理・出力を書き出します
- 契約条件を確認する: 情報システム・法務の担当が、料金プラン・利用規約・データの扱いを公式サイトで確認します
- 声のクローンは同意を取ってから: 社員などの声を使う場合は、本人の同意を文書で残します
- 開発部門はAPIで小さく試作する: 音声応答なら、Eleven v4 Turboで限られた質問だけに答える試作から始めます
注意点
- 入力する情報: 顧客の個人情報や未公開の情報を原稿に入れてよいか、社内ルールで先に決めておきましょう
- 声のクローンの扱い: 10秒の音声で声を再現できるとされているため、なりすましへの悪用に注意が要ります。本人の同意と、生成した音声であることの明示を検討してください
- 日本語の品質: 公式ドキュメントは、言語によって流暢さに差があるとしています。読み方の指定(IPA=国際音声記号)の改善が日本語の固有名詞にどこまで効くかは示されていません。社名や専門用語の読みは必ず人が確認してください
- 機能の制約: 公式ドキュメントでは、Eleven v4はSSML(読み方を細かく指定する記法)に対応せず、Style・Speedのスライダーも使えないとされています。音声タグもまだ完全ではないとしています
- 文字数の上限: モデル一覧では、Eleven v4の文字数上限は10,000(音声で約10分)とされています。長い教材は分けて作る前提で計画しましょう
- 料金: モデル別の料金は発表本文に書かれていません。利用量が増える前に料金ページで確認してください
TERRAISEに相談する
音声合成を研修動画・問い合わせ対応・教材のどこに当てはめるかは、業務を入力・処理・出力に分けると整理しやすくなります。60分の無料相談で、自社・自校の業務に合わせた使い方を一緒に整理できます。学校での活用は教育機関向けAI教育、社内での使い方の研修はAX Academyもご覧ください。
出典(2026年10月3日 15:09 確認)
- ElevenLabs「Eleven v4: Our most expressive text-to-speech AI model yet」
- ElevenLabs「Models(ElevenLabs公式ドキュメント:モデル一覧)」
- ElevenLabs「Eleven v4(ElevenLabs公式ドキュメント)」
- ElevenLabs「Eleven v4 TurboがElevenAgentsで利用可能に(ElevenLabs公式ブログ)」
製品名・機能・提供範囲・料金は変わることがあります。導入前に必ず公式情報をご確認ください。
