プロンプトの書き方は、目的、文脈、制約、出力形式、評価基準の5項目を明示すると改善できます。
- 要点1: 良いプロンプトは長い呪文ではなく、業務要件を整理した指示文
- 要点2: 悪い例と改善例を同じ評価基準で比べると改善効果を検証しやすい
- 要点3: 企業利用では機密管理、最小権限、人間承認を組み合わせる
対象: 生成AIを業務で使う経営者、管理職、DX推進担当者
今日やること: 頻出業務を1つ選び、成功条件を3項目で定義する
この記事の目次
生成AIの回答が流暢でも、そのまま業務に使えるとは限りません。必要な項目が抜けていたり、根拠のない内容が混ざったりするからです。
プロンプトの書き方で差が出るのは、気の利いた表現を使ったときではありません。目的、文脈、制約、出力形式、評価基準を整理し、モデルが判断に迷う余地を減らしたときです。
この記事では、OpenAI、Anthropic、Googleの公式ガイドに共通する考え方を基に、10の原則、改善例、テンプレート、評価方法、企業利用の安全策を解説します。
プロンプトとは?生成AIへの指示文の役割
プロンプトとは、生成AIに渡す指示や質問、参考資料、出力条件をまとめた入力です。短い質問も、複数の資料と詳細な条件を含む長い指示もプロンプトに該当します。
生成AIの中核には、大量の文章から言葉のつながりを学習した大規模言語モデルがあります。大規模言語モデルは、与えられた文脈に続く可能性の高い言葉を生成します。そのため、目的や条件が曖昧な入力では、もっともらしくても用途に合わない回答が返ることがあります。
大規模言語モデルの基礎は、LLMとは?仕組みと活用法、企業導入を徹底解説でも解説しています。
プロンプトとプロンプトエンジニアリングの違い
プロンプトは個々の指示文です。一方、プロンプトエンジニアリングは、指示文を設計し、結果を評価し、改善を重ねる一連の取り組みを指します。
一度だけ良い回答が出ても、別の入力で失敗するなら業務では安定しません。複数のケースで品質を確認し、変更後に再テストするところまでが設計の範囲です。
詳しい設計手法は、プロンプトエンジニアリング完全ガイドを補足として参照してください。
良い文章と良いプロンプトは一致しない
自然で丁寧な文章を書けば、必ず良い回答が返るわけではありません。生成AIに必要なのは、依頼の背景と判断基準です。
たとえば「分かりやすい報告書を書いてください」という文は丁寧ですが、「誰が読むのか」「何を判断するのか」「何を根拠にするのか」が分かりません。生成AIは不足した条件を推測するため、依頼者の意図と回答がずれます。
良いプロンプトは、文章力を競うものではありません。業務要件を、生成AIが処理できる形に変換した仕様です。
良いプロンプトを書く前に決める5項目
Anthropicのプロンプトエンジニアリング概要は、改善技法を試す前に成功基準と評価方法を用意するよう案内しています。書き方を考える前に、次の5項目を決めます。
| 項目 | 決める内容 | 会議要約の例 |
|---|---|---|
| 目的 | 出力を何に使うか | 次回会議までの実行管理 |
| 対象読者 | 誰が読むか | 部門長とプロジェクト責任者 |
| 成功条件 | 何を満たせば合格か | 決定事項、担当者、期限が正確 |
| 評価方法 | どう合否を判定するか | 原文との照合と担当者レビュー |
| 情報区分 | 何を入力できるか | 承認済み議事録のみ |
目的は出力の用途まで書く
「要約する」だけでは、残すべき情報を決められません。経営判断用なのか、担当者の実行管理用なのかによって要約の粒度が変わります。
目的は「経営会議で投資判断に使う」「次回までの担当と期限を管理する」のように、利用場面まで書きます。これにより、生成AIが重要度を判断しやすくなります。
成功条件は観察できる言葉にする
「分かりやすい」「質が高い」といった形容だけでは、担当者ごとに判定が変わります。成功条件は、結果を見て確認できる形にします。
会議要約なら、次のように定義できます。
- 決定事項を漏らさない
- 担当者と期限を原文どおりに記載する
- 提案と決定を分ける
- 原文にない情報を補わない
- 不明な項目は「記載なし」とする
この条件は、そのままプロンプトと評価表の両方に使えます。
入力できる情報を先に区分する
生成AIの入力欄に貼り付けられるからといって、社内規程や契約上も入力できるとは限りません。個人情報、営業秘密、顧客との秘密保持契約に関わる資料は、利用環境と情報区分を確認します。
「あとで伏字にする」では遅い場合があります。入力前に匿名化し、承認済みの環境だけを使う運用が必要です。
\ Claude Codeの導入、何から始めればいいかわかります /
法人様のAI導入に関するご相談はこちらプロンプトの書き方を改善する10原則
OpenAIのプロンプトエンジニアリングガイド、Anthropicの明確で直接的な指示のガイド、Googleのプロンプト設計戦略には共通点があります。ここでは、業務で使いやすい順に10原則へ整理します。
1. 目的と作業を具体化する
「市場を調べて」ではなく、調査結果を何に使い、何を調べるのかを指定します。
国内の法人向け生成AI市場について、2025年以降に公開された資料を調べてください。目的は、2027年度の事業計画で重点業界を3つ選ぶことです。市場規模、成長要因、導入障壁、出典URLを表にしてください。
期間、地域、対象、判断目的が分かるため、回答範囲をそろえやすくなります。
2. 対象読者と必要な文脈を渡す
同じ内容でも、経営者向けと実務担当者向けでは説明が変わります。読者の役職、知識レベル、関心事項を指定します。
社内固有の略語や商品名を使う場合は、必要な定義も添えます。ただし、無関係な資料を大量に渡すと、重要な条件が埋もれます。文脈は量ではなく、作業との関連性で選びます。
3. 制約と出力形式を明示する
文字数、文体、必須項目、禁止事項、表の列を指定すると、後工程の修正が減ります。
出力は600字以内です。結論、根拠、リスク、次の行動の4見出しで構成してください。数値には出典URLと公開日を添えてください。確認できない数値は推測せず「確認できず」と記載してください。
JSONや表を指定する場合は、列名やスキーマまで示します。出力をシステムへ渡す用途では、生成後に型検証も行います。
4. 指示と参考資料を分ける
長いプロンプトでは、指示、ルール、資料、出力形式を見出しで分けます。生成AIが、参考資料の文章を依頼者の命令と取り違えるリスクを減らせます。
# 目的会議記録から決定事項を抽出する。# ルール- 原文にない内容を補わない- 提案と決定を分ける- 不明な項目は「記載なし」とする# 出力形式| 決定事項 | 担当者 | 期限 | 根拠となる発言 |# 処理対象の会議記録ここに記録を貼る
Anthropicは、長く複雑なプロンプトで指示、文脈、例、入力をXMLタグで分ける方法も紹介しています。Markdown見出しとXMLタグのどちらを使う場合も、区切り方を一貫させます。
5. 望む出力例を示す
文章だけでは判断基準を伝えにくいときは、入力例と理想的な出力例を示します。この方法はfew-shot promptingと呼ばれます。
例は本番データに近く、正常例だけでなく境界事例も含むものが適切です。AnthropicのMultishot promptingガイドは、関連性、多様性、構造のある例を推奨しています。
誤った例や古い例を入れると、その誤りも再現されます。例の品質はプロンプト本文と同じように管理します。
6. 複雑な作業を工程に分ける
調査、分析、企画、文書作成を一度に依頼すると、どの工程で誤りが生じたか分かりにくくなります。作業を次のように分けます。
- 資料から確認済みの事実を抽出する
- 不足情報と矛盾を列挙する
- 論点を分類する
- 選択肢を作る
- 評価基準に沿って比較する
- 指定形式に編集する
各工程の出力を確認できるため、誤りの発見と修正が容易になります。高リスクな業務では、工程の途中に人間の承認を置きます。
7. 根拠と不確実性の扱いを指定する
生成AIは、情報が不足していても自然な文章を作れます。その流暢さを正確さと取り違えないため、根拠の範囲を指定します。
- 提供資料だけを根拠にする
- 根拠箇所を引用する
- 事実と推測を分ける
- 根拠がない場合は回答しない
- 不明な項目は「不明」と記載する
この指示で誤情報が完全になくなるわけではありません。重要な判断では、引用箇所と原資料を人間が照合します。
8. 禁止だけでなく、代わりの行動を書く
「専門用語を使わない」とだけ書くと、どの表現へ置き換えるべきか分かりません。
「専門用語を使う場合は、初出時に中学生でも理解できる一文の説明を添える」のように、望む行動を示します。禁止事項が必要な場合も、代替行動を組み合わせます。
9. 複数の入力で評価する
一度の成功例だけでは、プロンプトの品質を判断できません。業務のリスクに応じて、通常ケースに加え、長文、情報不足、表記揺れ、例外、悪意ある入力などを評価セットへ含めます。
変更前後で同じ評価セットを使うと、改善した項目と悪化した項目を比較できます。OpenAIの評価ベストプラクティスも、実運用を代表するデータと継続的な評価を重視しています。
10. モデルやシステムの変更後に再評価する
同じプロンプトでも、モデル、参照資料、検索方式、ツール、システム指示が変われば結果も変わります。プロンプト本文だけを固定しても、業務品質は固定されません。
変更履歴には、利用目的、入力条件、評価セット、評価結果、更新日、承認者を残します。プロンプトを単なるメモではなく、業務資産として管理する考え方です。
悪いプロンプトと改善例、仕事で使えるテンプレート
書き方の違いは、具体例で確認すると分かりやすくなります。ここでは、悪い例を長文化するのではなく、不足している判断材料を補います。
改善例1:会議要約
悪い例
この会議を分かりやすく要約してください。
「分かりやすい」の基準と用途がなく、提案と決定が混ざる可能性があります。
改善例
# 目的次回会議までの実行管理に使うため、会議記録を整理してください。# 抽出項目- 確定した決定事項- 担当者- 期限- 未決事項- 次回確認する論点# ルール- 提案と決定を分ける- 原文にない担当者や期限を補わない- 不明な項目は「記載なし」とする- 各項目に根拠となる発言を添える# 出力形式Markdownの表# 会議記録[承認済みの記録を貼る]
評価では、決定事項の再現率、担当者と期限の正確性、原文にない情報の有無を確認します。
改善例2:顧客向けメール
悪い例
お客様に丁寧なメールを書いてください。
メールの目的、相手との関係、確定事項が分からないため、生成AIが内容を補う余地が残ります。
改善例
既存顧客の担当者へ、定例会の日程候補を確認するメール案を作成してください。相手との関係:月1回の定例会を6か月継続目的:候補3件から1件を選んでもらう必須情報:候補日時、所要時間60分、オンライン開催文体:簡潔で丁寧。過度な謝辞は不要禁止:未確定の議題や成果を補わない出力:件名1案と本文。本文は300字以内
送信前には、宛名、日時、固有名詞、約束内容を人間が確認します。
改善例3:情報抽出
悪い例
この資料から重要な数字を抜き出してください。
重要度の基準がなく、単位や対象期間を取り違える可能性があります。
改善例
添付資料から、売上高、営業利益、従業員数、対象期間を抽出してください。出力列:項目、数値、単位、対象期間、掲載ページ、原文引用ルール:- 連結と単体を区別する- 百万円と億円を変換しない- 訂正資料や差し替え資料がある場合は、訂正対象と適用範囲を確認し、公式の最新版を用いる- 見つからない項目は「記載なし」とする
抽出業務では、項目単位の正確性と再現率を測ります。数値だけでなく、単位、期間、対象範囲も一組で照合します。
汎用プロンプトテンプレート
# 役割[必要な専門性や立場]として作業してください。# 目的[この出力を何に使うか]# 対象読者[役職、知識レベル、関心事項]# 入力[処理対象の文章やデータ]# 実行内容1. [作業1]2. [作業2]3. [作業3]# 制約- [利用できる情報の範囲]- [文字数、文体、禁止事項]- 原文にない情報を推測で補わない- 判断できない場合は「不明」と明記する# 出力形式[表、箇条書き、JSON、見出し構成]# 品質基準- [正確性]- [必要項目の網羅]- [根拠]- [読みやすさ]# 参考例入力例:[例]出力例:[理想形]
すべての欄を毎回埋める必要はありません。単純な文章修正なら、目的、入力、出力条件だけでも足ります。長いプロンプトが良いのではなく、判断に必要な情報が過不足なく含まれていることが大切です。
「役割」の指定も万能ではありません。専門家の役割を与えるだけで事実確認が済むわけではないため、根拠、評価基準、人間確認を別に設けます。
\ 業務自動化のお悩み、プロが30分で整理します /
法人様のAI導入に関するご相談はこちら指示どおりに答えないときの改善と評価の手順
回答が期待と違うとき、表現を思いつきで足すとプロンプトが長くなり、別のケースで失敗しやすくなります。原因を6段階で切り分けます。
1. 失敗を分類する
まず、何が悪かったのかを具体化します。
- 必須項目の欠落
- 事実誤認
- 指定形式の違反
- 長さや文体のずれ
- 根拠のない補完
- 安全ルールの違反
「何となく使いにくい」では、修正箇所を決められません。失敗を評価項目へ変換します。
2. 成功条件を見直す
評価項目がプロンプトに書かれているか確認します。担当者と期限が必要なのに「要約してください」としか書いていないなら、モデルではなく要件の不足です。
3. 不足する文脈を追加する
対象読者、利用目的、用語の定義、参照範囲が不足していれば追加します。一方、回答に影響しない会社沿革や長い背景説明は削ります。
4. 良い例と境界例を追加する
形式の崩れや分類ミスが続く場合は、理想出力の例を示します。「提案だが未決定」「担当者はいるが期限なし」といった境界例も含めると、判断基準を伝えやすくなります。
5. タスクを分割する
抽出と評価と文章化が混ざっている場合は、工程を分けます。各工程の中間結果を確認できるため、誤りの発生箇所を特定できます。
6. 同じ評価セットで回帰テストする
修正前後を同じ入力で比べます。通常ケースの平均点だけでなく、外部公開や誤操作につながる重大な失敗が増えていないかも確認します。
用途ごとの評価項目は次のように変わります。
| 用途 | 主な評価項目 |
|---|---|
| 要約 | 重要事項の再現率、事実誤認、不要情報、長さ |
| 情報抽出 | 項目別の正確性、再現率、単位と期間 |
| 顧客対応 | 正確性、社内方針の順守、解決性、文体 |
| 文書作成 | 要件充足、構成、根拠、修正工数 |
| RAG回答(社内文書などを検索して回答へ反映する仕組み) | 根拠との整合、引用の正確性、回答不能判断 |
| エージェント | 完了率、誤操作率、承認逸脱、実行時間 |
評価セットには、頻出ケース、重要な低頻度ケース、欠損、矛盾、攻撃的入力、回答すべきでないケースを含めます。専門家レビュー、ルール判定、利用者のフィードバック、自動評価を組み合わせ、単一の点数だけで判断しません。
企業でプロンプトを使う際の安全策
プロンプトの工夫だけで、情報漏洩や誤操作を防ぐことはできません。企業利用では、契約、アクセス権限、入力制御、出力検証、人間承認を組み合わせます。
機密情報は契約と設定で判断する
「法人向けだから何でも入力できる」「APIだから保存されない」といった一般化は避けます。次の項目を利用時点で確認します。
- 入出力がモデル学習に使われる条件
- データの保存期間と削除条件
- 管理者が確認できるログ
- データの処理地域
- 外部接続先とサブプロセッサ
- 社内の情報分類とアクセス権限
- 個人情報、秘密保持契約、業法上の制約
「学習に使われないこと」と「保存されないこと」は別の条件です。不要な個人情報や営業秘密は、入力前に削除または匿名化します。
OpenAI APIを本番運用する際の考え方は、OpenAI APIとは?料金、使い方、安全な導入法でも解説しています。入力資料や生成物の権利関係は、AIと著作権を企業向けに解説も確認してください。
プロンプトインジェクションを多層防御で扱う
プロンプトインジェクションとは、Webページ、メール、文書、ユーザー入力に含まれる命令によって、生成AIが本来の指示から逸脱する問題です。外部資料を読む生成AIや、ツールを実行するAIエージェントで特に注意が必要です。
「以前の指示を無視しないでください」と書くだけでは十分ではありません。OWASPのPrompt Injection解説も、権限管理や人間承認を含む複数の対策を挙げています。
実務では次を組み合わせます。
- 信頼できる指示と外部入力を明確に分離する
- 外部文書を命令ではなく処理対象データとして扱う
- ツールやAPIには必要最小限の権限だけを与える
- 公開、削除、送金、本番変更は人間が承認する
- 出力をそのままSQL、シェル、HTMLとして実行しない
- 許可リスト、型チェック、スキーマ検証を行う
- 攻撃入力を含むテストを定期的に実施する
- ログを監視し、停止と復旧の手順を用意する
人間確認の位置を決める
人間による確認は、最後に文章を眺めるだけでは不十分です。リスクが高い操作の直前に承認点を置きます。
法務、医療、財務、人事の重要判断、顧客への正式回答、契約条件、外部公開、データ削除、支払い、本番環境の変更は、人間の承認対象です。確認者には生成結果だけでなく、入力資料と引用元も提示します。
NISTのArtificial Intelligence Risk Management Framework(AI RMF)は、AIリスクをGovern、Map、Measure、Manageの継続的な活動として整理しています。プロンプトは、この管理全体の一部です。
\ AI活用の「次の一手」を一緒に考えませんか /
法人様のAI導入に関するご相談はこちらプロンプトの書き方でよくある質問
Q. プロンプトは長いほど良いですか?
長いほど良いわけではありません。目的、文脈、制約、出力形式、評価基準が足りていることが大切です。単純な作業では短くし、複雑または高リスクな作業だけ詳細化します。
Q. AIに役割を与えると回答は良くなりますか?
役割指定は、説明の視点や専門用語の水準をそろえる手段として使えます。ただし、役割を与えるだけで事実確認や専門家レビューを代替できるわけではありません。目的、根拠、成功条件も指定してください。
Q. ハルシネーションを防ぐプロンプトはありますか?
ハルシネーションとは、生成AIが根拠のない内容をもっともらしく出力する現象です。参照範囲、引用、不明時の処理を指定すると発見しやすくなりますが、完全には防げません。重要な出力は原資料と照合し、人間が確認します。
Q. ChatGPT、Claude、Geminiで書き方は違いますか?
明確な指示、必要な文脈、出力形式、例示、反復評価という基本原則は共通します。ただし、モデルごとに得意分野、推奨構造、利用できる機能が異なります。公式ドキュメントを確認し、同じ評価セットで比較します。
Q. プロンプトは社内でどのように管理しますか?
プロンプト本文だけでなく、利用目的、対象業務、入力可能な情報、評価セット、評価結果、更新日、承認者を一組で管理します。モデルや参照資料を変更した際は、同じ評価セットで再テストします。
まとめ
プロンプトの書き方は、言葉の巧さよりも要件の明確さで決まります。目的、文脈、制約、出力形式、評価基準の5項目をそろえ、悪い例と改善例を同じ評価基準で比べてください。
最初から全社共通の巨大なテンプレートを作る必要はありません。頻度が高く、結果を人間が確認しやすい業務を1つ選び、複数ケースで評価します。その結果を基に、部署ごとの標準、承認手順、入力可能な情報区分へ広げる方が安全です。
参考にした公式資料
- OpenAI Prompt engineering
- OpenAI Evaluation best practices
- Anthropic Prompt engineering overview
- Anthropic Multishot prompting
- Anthropic Use XML tags to structure your prompts
- Google AI Prompt design strategies
- OWASP Prompt Injection
- NIST Artificial Intelligence Risk Management Framework
いずれも2026年8月9日に確認しました。
プロンプトを社内の業務標準として整備したい企業へ
株式会社NexaのAI顧問では、生成AIの活用方針、業務選定、評価設計、セキュリティを含む導入と運用を支援しています。個人の工夫に依存しない仕組みへ移行したい段階からご相談いただけます。


