さくらのAI Engineとは?料金・モデルと2方式の始め方

さくらのAI Engineとは?料金・モデルと2方式の始め方

公式ドキュメント・公式発表などの一次情報を確認したうえで、株式会社Nexaが執筆・更新しています。AIツールの仕様や料金は変わることがあるため、導入判断の前に各公式サイトの最新情報もご確認ください。運営会社について

さくらのAI Engineは、共有APIと専有型の2方式を、利用するモデルや接続要件、料金の考え方で比較すると、自社に合う導入方法を選びやすくなります。

  • 料金: 共有APIには無償枠がありますが、RAGの文書保管は無償プランでも有料です。
  • モデル: 共有APIは提供モデルから選び、専有型では持ち込むモデルに合わせて構成を相談します。
  • 開始方法: 共有APIは管理画面から申し込み、専有型は利用要件を整理して見積もりを依頼します。

対象読者:国内の生成AI基盤を検討する経営者、DX推進担当者、情報システム部門

今日やること: 利用したいモデルと、扱うデータ、必要な接続方式を書き出す

この記事の著者
株式会社Nexa 代表取締役川島 陸

一橋大学経済学部卒業後、フォーティエンスコンサルティング株式会社(旧 株式会社クニエ)にて法人向けAI導入支援等を経験。独立後、AI系メディア運営やDify/n8nの導入支援を経て、株式会社Nexaを創業。法人向けAI研修・AI導入支援・AI関連メディア運営を手掛ける。

さくらのAI Engineを検討するときは、提供済みモデルを使う共有APIと、自社向けにモデルを運用する専有型を分けて考えます。2026年10月8日にはプライベートエディションの提供が始まり、選択肢が広がりました。

ただし、無償プランなら全機能が無料になるわけではありません。定額の専有型も、処理能力が無制限という意味ではありません。料金の単位と運用範囲を確認し、最初に試す業務を絞ることが導入判断の近道です。

本記事の仕様と料金は、2026年10月10日に公式ページで確認しました。以下の「共有API」は、プライベートエディションと区別するための呼び方です。

さくらのAI Engineとは

さくらのAI Engineは、さくらインターネットが提供する生成AIの推論基盤です。推論とは、学習済みのモデルに文章などを入力し、回答を生成させる処理を指します。企業側でモデルを動かすGPUサーバーを構築せず、処理結果を利用できます。

自社アプリケーションと基盤をつなぐのがAPIです。APIはソフトウェア同士が依頼や結果を受け渡す窓口で、社内ツールから要約や質問応答を呼び出せます。完成した社内システムが自動的に手に入るサービスとは区別しましょう。

公式サイトは国内でのモデル実行と通信を説明しています。一方、提供モデルには国内開発と海外開発の両方があります。「国内の基盤で使うこと」と「国産モデルを選ぶこと」は別の選定条件です。出典:さくらのAI Engine公式製品ページ。

共有APIとプライベートエディションの比較

既存の提供モデルを小さく試すなら共有API、独自モデルや専有構成が必要ならプライベートエディションが検討対象です。どちらも同じ料金体系ではありません。

比較項目 共有API プライベートエディション
モデル 提供済みのモデルから選択 独自モデルや追加学習済みモデルなどをホスティング
料金の基本 基盤モデル無償プラン/従量課金プラン GPU単位の月額定額、構成に応じた個別見積もり
利用開始 コントロールパネルで申し込み 問い合わせと要件相談
環境 用意された推論APIを利用 顧客専用のGPU環境を利用
接続の検討 利用するAPIとアプリ側の接続を確認 閉域接続にも対応。構成を個別確認
主な判断軸 無料枠、提供モデル、利用量 持込モデル、継続負荷、専有要件

専有型では推論基盤の構築、運用、監視を事業者が担います。これをフルマネージドと呼びますが、自社の業務アプリや回答の正しさまで管理不要になるわけではありません。専有型は2026年10月8日の提供開始告知と専有型の公式製品ページで確認できます。

さくらのAI Engineで自社アプリから共有APIまたは専有型へ依頼し回答を受け取る流れ図1: 共有APIと専有型は、必要なモデルと接続要件を基準に選びます。

共有APIの料金と無料枠

共有APIでは、無料枠を「リクエスト数」、超過分をモデルごとの処理量で管理します。リクエストはAPIへ処理を依頼する回数です。トークンはモデルが文章を扱う際の単位で、文字数と常に一致するわけではありません。

次の表は通常モデルの代表例です。価格は税込で、超過単価は従量課金プランの無料枠を超えた場合に適用されます。

機能とモデル 月間無料リクエスト枠 超過時の公式単価
テキスト生成:gpt-oss-120b 3,000回 入力0.15円/10,000トークン、出力0.75円/10,000トークン
テキスト生成:llm-jp-3.1-8x13b-instruct4 3,000回 入力0.15円/10,000トークン、出力0.75円/10,000トークン
文字起こし:whisper-large-v3-turbo 50回 0.5円/60秒
ベクトル化:multilingual-e5-large 10,000回 入力2円/10,000トークン、出力無料
RAGの文書保管 無料枠なし 3円/100チャンク

基盤モデル無償プランでは、枠を超えるとリクエストが制限されます。自動的に従量課金へ移行する仕組みではありません。従量課金プランにも無料枠があり、翌月にリセットされます。ただし、対象外のモデルもあるため、すべてに同じ無料枠が付くとは考えないでください。

利用量の見積もりでは、会話回数だけでなく、入力文の長さと回答の長さも記録します。料金表の最小課金単位も確認が必要です。出典:公式の料金体系と提供モデル表。


AI導入に関するお困りごとは、株式会社NexaのAI顧問がサポートします。「何から始めればいいか分からない」という段階からご相談いただけます。

AI顧問の無料相談はこちら →


プライベートエディションの料金

プライベートエディションは、GPU単位の月額定額制です。公開ページに一律の金額はなく、構成に応じて見積もる方式です。共有APIのトークン単価を、そのまま専有型へ当てはめることはできません。

定額なのはGPU単位の料金方式であり、「どれだけ同時に依頼しても遅延しない」という性能保証ではありません。見積もり時には、使いたいモデル、同時利用の規模、回答を待てる時間を合わせて伝えます。

接続構成、追加の基盤、運用条件など、見積もりに何が含まれるかも確認しましょう。一定額だから共有APIより安いと決めつけず、自社の継続的な利用量と比較します。出典:専有型の料金と利用の流れ。

利用モデルの選び方

共有APIのモデルは、通常モデル、クローズドモデル、パブリックプレビューを分けて確認します。名前が一覧に載っていても、全モデルが同じ条件で使えるわけではありません。

区分 公式ページの掲載例 導入前の確認
通常モデル gpt-oss-120b、llm-jp-3.1-8x13b-instruct4 対象業務での回答品質と課金単位
クローズドモデル PLaMo 3.0 Prime、cotomi v3 申請、許諾、利用条件、料金
パブリックプレビュー Kimi-K2.6、Kimi-K2.7-Code、Qwen3.6-35B-A3B、gemma-4-31B-it 提供期間、仕様変更、安定性

プレビューは、実際の環境での検証やフィードバックを目的とした提供です。予告なく終了する場合があり、動作や仕様、継続時の料金が変わる可能性も示されています。本番の唯一の選択肢にする前に、代替モデルを検討しましょう。

上表は製品ページの表示名です。実装に使うAPIモデル名を表示名から推測せず、管理画面で確認してください。公式操作ガイドは、左メニューの「利用可能なモデル」で実際の選択肢を確認するよう案内しています。

PLaMo 2.0の提供終了予定に注意

PLaMo 2.0-31B Instructedは、2026年10月12日に提供終了予定です。この記事の確認日は10月10日であり、終了済みではありません。製品ページのモデル表に名前が残っていても、新規導入の候補にする際は終了告知を優先して確認します。

公式告知では、PLaMo 3.0 Primeは継続提供すると案内されています。ただし、移行先の利用には申請が必要です。料金も承認された利用者に表示されるため、旧モデルと同額だと仮定しないでください。

モデル変更時は、よく使う質問を同じ条件で比較し、出力形式や回答の違いを点検します。出典:PLaMo 2.0の終了告知、PLaMo 3.0 Primeの提供条件。

\ AI活用の「次の一手」を一緒に考えませんか /

AI顧問の無料相談はこちら

テキスト生成以外にできること

共有APIでは、文章生成のほか、音声の文字起こし、テキストのベクトル化、音声合成、文書管理と検索を利用できます。最初からすべてを組み合わせるより、業務に必要な処理を切り分けると検証しやすくなります。

ベクトル化は、文章の特徴を数値の並びで表す処理です。似た意味の文書を探す用途などに使います。文字起こしは音声を文字へ、音声合成は文字を音声へ変える別の処理で、対応モデルや利用条件も異なります。

たとえば議事録の下書きなら、音声の文字起こしと、その結果の要約を別々に確認します。固有名詞の誤認識がある状態で要約すると、誤りが残るためです。機能一覧と使い方は公式操作ガイドで確認できます。

RAGは無料枠と別に保管料を確認

社内資料を根拠に回答させる場合は、RAG(検索拡張生成)を検討します。質問に関連する文書を検索し、その内容をモデルに渡して回答を作る方法です。モデル自体へ資料を追加学習させることとは異なります。

さくらのAI Engineでは、登録した文書をベクトル化して保管し、検索と回答生成に使います。文書を分割した単位がチャンクです。公式料金表には保管料として3円/100チャンクが示され、基盤モデル無償プランにも無料枠はありません。

保管料とは別に、ベクトル化や回答生成に使うモデルの利用条件と料金も確認します。RAGを試すだけのつもりでも、アップロードした文書を残せば保管が続きます。基本情報には、すべての文書を削除するまで課金対象になると明記されています。

文書を登録できたことと、内容を正しく取り込めたことも別です。スキャンしたPDFや複雑なレイアウトは解析に失敗する場合があります。検索結果の本文を確認し、必要ならテキストへ変換して試します。出典:基本情報の課金上の注意、RAGの操作と取り込み制限。

さくらのAI Engineで文書を登録して検索と回答を行い保管と処理の料金を区別する図図2: RAGでは文書の保管と、ベクトル化・回答生成の利用条件を分けて確認します。

国内処理とZDRの適用範囲

公式ページでは、入力データと生成された応答を国内データセンターで処理し、モデル学習やサービス改善に利用しないと説明しています。推論の入力や応答を保存しない方針は、ZDR(Zero Data Retention)と呼ばれています。

ここで「すべての機能でデータが一切残らない」と解釈するのは不正確です。RAGでは検索のために文書を保管します。操作ガイドの解約説明も、RAGへアップロードした文書を保管対象として区別しています。

さらに、自社アプリ、接続する別サービス、運用ログの扱いは別途点検します。さくらの基盤が国内処理でも、アプリが外部へ同じ入力を転送する構成なら、処理全体が国内だけで完結するとは限りません。入力からログまで、保存先と送信先を書き出して確認しましょう。

API互換性には機能ごとの制約がある

共有APIは、Chat Completions API、Responses API、Messages APIを提供しています。前の2つはOpenAI互換、Messages APIはAnthropic互換の形式として案内されています。互換とは接続形式を合わせやすいという説明であり、すべての機能や出力が同じという保証ではありません。

確認日時点の公式API説明には、Responses APIは画像入力とマルチターン会話に非対応とあります。マルチターン会話は、前のやり取りの文脈を引き継いで会話を続けることです。別のAPIの画像対応と混同しないようにします。

Messages APIでは、利用できるモデルとして preview/Kimi-K2.6 が記載されています。既存ツールを移すときは、接続形式、対象モデル、使っている機能をセットで照合してください。モデル名だけを変更して動作すると決めつけないことが必要です。

共有APIの利用開始手順

共有APIは、会員IDとプロジェクトを用意し、プラン選択と認証情報の発行を経て、公開情報で試す順に進めます。

1. 会員IDとプロジェクトを用意

共有APIを使うには、さくらインターネットの会員IDと、さくらのクラウドのプロジェクトが必要です。公式の利用手順では、本人確認のための電話認証とクレジットカード登録も必要とされています。無償プランを選ぶ予定でも、申込前提を確認しましょう。

社内で試す場合は、個人の試用か、会社が管理する検証かを先に決めます。請求の確認者、管理画面を操作する担当者、検証終了時に削除する担当者を明確にしておくと、文書や認証情報を残したまま放置する事態を避けやすくなります。

登録条件は公式の利用手順に沿って確認します。社内利用の承認を取る前に、実データをアップロードする必要はありません。

2. プラン選択とトークン発行

コントロールパネルで利用規約に同意し、プランを選択します。続いて左メニューの「アカウントトークン」を開き、「アカウントトークンを作成」から名前を入力し、「作成する」を選びます。これは公式マニュアルに記載された操作です。

アカウントトークンは、APIを呼ぶ側の認証に使う秘密情報です。料金計算の「トークン」とは意味が異なります。発行した値は再表示されないため、社内で承認された方法で保管してください。

公開するコード、画面のスクリーンショット、問い合わせ文に値を含めないようにします。不明になった場合は新しいものを発行し、不要なものを削除するのが公式の案内です。担当者が変わるときの管理方法も決めておきましょう。

3. PlaygroundとAPIで確認

まずモデルの回答を確認したい場合は、Playgroundを使えます。ブラウザ上でモデルを試す機能で、プログラムを書かずに応答を比較できます。公式サイトでは、コントロールパネルから起動できると案内されています。

最初の入力には、公開済みの製品説明など、社外送信が認められた文章を選びます。同じ質問で回答の正確さ、指示への従い方、待ち時間を比べましょう。流暢な文章が返るだけでは、業務に必要な条件を満たしたことにはなりません。

業務アプリへつなぐ段階では、公式のAPI接続先とテスト手順に沿って確認します。この記事は公式手順の整理であり、筆者によるアカウント作成やAPI推論の実測結果ではありません。

専有型の利用開始は要件整理から

プライベートエディションは、公式窓口へ問い合わせて進めます。共有APIのプランを変更すれば自動的に専有環境へ移れる、と公開情報から判断することはできません。

相談前に、次の項目を用意すると要件を伝えやすくなります。

  • 利用したいモデルとバージョン、持込モデルの利用条件
  • 想定する入力の長さ、出力の長さ、同時に利用する規模
  • 社内限定か外部向けか、閉域接続が必要か
  • 障害時の対応、監視、変更管理で確認したい範囲
  • 予算、開始希望時期、モデルを切り替える条件

これらは見積依頼に向けた編集上のチェック項目です。公式製品ページは特殊なモデル構成や複雑なAPI仕様を個別相談としています。共有版のRAG機能が専有型にも同条件で付くかなど、確認できていない内容は要件として問い合わせます。出典:専有型のサービス範囲。

業務への適用を小さく評価する

導入評価では、実際の業務に近い入力と、合否を判断できる答えを用意します。以下は用途を考えるための例であり、導入実績や効果の実測値ではありません。

検証する業務の例 試す処理 合否を見るポイント
公開資料の要約 テキスト生成 条件や例外を落としていないか
社内規程への質問 RAGで検索と回答 現行規程の該当箇所に基づいているか
自社モデルによる応答 専有型のモデル運用 想定負荷で必要な応答が返るか

回答の見た目だけでなく、修正にかかった手間も記録します。RAGなら根拠文書が取得できたか、生成時に読み違えたかを分けると改善先が明確になります。モデルの大きさや名称だけで採用を決めず、業務側の合格条件で判断しましょう。

つながらないときの確認順序

共有APIでエラーが出た場合は、まず無料枠の残量と一時的な制限を確認します。公式FAQでは、無料枠の超過に加え、アクセス集中によって429エラーが返る場合もあると説明しています。429は、リクエストが制限されている状態を示します。

無料枠が残っている場合でも、無条件に連続再送するのではなく、公式案内に沿って時間を置きます。次に、認証用トークンの取り違え、利用申請が必要なモデル、APIとモデルの組み合わせを確認します。

RAGの問題なら、文書が正しく取り込まれたかも別に点検してください。接続できない問題と、つながるが回答が不正確な問題は、調べる箇所が違います。出典:公式FAQ、操作ガイド。

モデルのライセンスと本番運用

商用利用を検討するときは、サービスの利用規約に加え、選ぶモデルの条件を確認します。モデルによってライセンスや追加の利用条件が異なるため、「一覧にあるモデルは同じ条件で使える」とは判断できません。確認先は公式のモデルライセンス表示です。

共有APIのサービス基本情報には、品質保証であるSLAの適用対象外と記載されています。専有型の契約条件まで同じとは限らないため、専有型は個別に確認します。本番では、利用できない間の代替手段や、人が処理を引き継ぐ条件を決めてください。

モデルの終了や変更も運用上の確認対象です。採用時の評価結果を残しておけば、次のモデルへ移るときに、何が変わったかを同じ基準で比べられます。

関連記事:設計の選択肢を詳しく知りたい方へ

共有APIか専有型かを決める基準

提供済みモデルで目的を満たせるか分からない段階なら、共有APIで小さく検証する進め方が考えられます。無料枠の有無だけでなく、申請条件やRAGの保管料まで含めて対象範囲を決めます。

一方、独自モデルを持ち込みたい、特定バージョンを継続したい、専有構成や閉域接続が必要という条件があれば、専有型の相談を進めます。公式製品ページも、こうした用途を想定しています。

選定資料には「必要なモデル」「扱うデータ」「利用量とピーク」「接続要件」「費用の範囲」を並べます。共有APIで必要な条件を満たせるか、専有化によって何を解決するかを説明できれば、無料か定額かだけに引っ張られずに比較できます。

さくらのAI Engineの会員登録からプラン選択と認証情報の管理まで利用開始時の確認事項図3: 共有APIを始める際は、認証情報を安全に保管し、公開情報で動作を確認します。

よくある質問

Q. さくらのAI Engineは無料で使えますか?

基盤モデル無償プランがあり、対象モデルを無料枠の範囲で利用できます。ただし、RAGの文書保管は無償プランでも有料です。クローズドモデルなど対象外もあるため、公式料金表で機能とモデルごとに確認してください。

Q. 無償プランでもクレジットカードは必要ですか?

公式の利用手順では、クレジットカード登録が必要とされています。会員ID、クラウドプロジェクト、電話認証も前提です。申込前に利用開始条件を確認しましょう。

Q. 入力した社内情報はモデルの学習に使われますか?

公式説明では、入力データや生成結果をモデル学習に使わないとされています。ただし、RAGへ登録した文書は検索のために保管されます。RAGの保存と削除を確認し、自社アプリ側のログも別に管理してください。

Q. 自社で追加学習したモデルを使えますか?

プライベートエディションは、独自開発モデルや追加学習済みモデルのホスティングを対象としています。実際の構成や対応条件は個別相談です。専有型の案内を確認し、モデルと想定用途を伝えます。

Q. 国内のサービスならすべて国産モデルですか?

いいえ。国内の基盤で動かすことと、モデルの開発元が国内であることは別です。公式の提供モデル一覧には国内外のモデルが掲載されています。開発元に条件がある場合は、基盤の所在地とは分けて確認します。

Q. 専有型は定額なので無制限に使えますか?

GPU単位の月額定額制ですが、無制限の同時処理を保証するという意味ではありません。専有型の仕様と見積もりを確認し、想定負荷と必要な応答速度を相談してください。

Q. プログラムを書かずに試せますか?

共有APIには、ブラウザでモデルの応答を確認するPlaygroundがあります。公式ページの利用の流れに沿って管理画面から起動します。業務システムへの組み込みは、試用とは分けて接続や運用を設計します。

まとめ:方式と検証対象を先に決める

さくらのAI Engineは、共有APIで提供モデルを使う方法と、プライベートエディションで専有環境を用意する方法を分けて検討します。共有APIでは無料リクエスト枠と超過課金、RAGの保管料を確認します。専有型ではモデルと負荷、接続要件を伝えて見積もりを取りましょう。

最初の行動は、社内情報をまとめて投入することではありません。利用したいモデル、扱うデータ、必要な接続を整理し、公開情報で試せる業務を選びます。その評価結果を基に、自社が必要とする運用条件と費用を比較してください。


AI導入に関するお困りごとをサポートします

株式会社NexaのAI顧問は、ツール選定から業務への適用、社内定着までを月額制でサポートします。特定のツールに限らず、「AIをどう使えばいいか分からない」という段階からご相談いただけます。

AI顧問の詳細・無料相談はこちら →





この記事で参照した外部情報

  1. さくらのAI Engine公式製品ページai.sakura.ad.jp
  2. 2026年10月8日の提供開始告知cloud.sakura.ad.jp
  3. 専有型の公式製品ページai.sakura.ad.jp
  4. 公式操作ガイドmanual.sakura.ad.jp
  5. PLaMo 2.0の終了告知cloud.sakura.ad.jp
  6. PLaMo 3.0 Primeの提供条件cloud.sakura.ad.jp
  7. 基本情報の課金上の注意manual.sakura.ad.jp
  8. 公式の利用手順manual.sakura.ad.jp
  9. 公式のモデルライセンス表示manual.sakura.ad.jp

本文中でリンクしている外部ページの一覧です(自動生成)。最終確認日は本記事の最終更新日 2026-10-10 で、リンク先の内容はその後変わることがあります。

AI導入を検討中の方へ

AIの力で、ビジネスを次のステージへ

まずはお気軽にご相談ください。貴社に最適なAI活用プランをご提案します。