AI Enablement
AIエージェント開発
AIエージェントを、PoCで終わらせない。
曖昧さはAIに。確実さはコードに。重要な操作は、人の承認に。
決定論×LLMのハイブリッド設計と評価駆動の運用で、
「監査できて、止められて、改善し続けられる」
AIエージェントを、本番運用まで引き受けます。
Our Approach
「賢さ」ではなく、
「任せられる構造」をつくる。
デモで動くAIエージェントと、業務を任せられるAIエージェントは、別物です。Gartnerは、エージェント型AIプロジェクトの40%超が2027年末までに中止されると予測しています。理由はコストの増大、ビジネス価値の不明確さ、そしてリスク統制の不備——つまずきの多くはモデルの賢さではなく、設計と運用にあります。
スパイスファクトリーのAIエージェント開発は、「何をAIに任せ、何を任せないか」の設計から始めます。計算・権限判定・確定操作など間違えてはいけない仕事は決定論的なコードに固定し、意図の解釈や言語化といった曖昧さの処理だけをLLMに委ねる。このハイブリッド設計により、ハルシネーションや悪意ある入力のリスクを「確率を下げる」のではなく「構造で封じ」ます。
そして、作って終わりにしません。版管理・評価ゲート・コスト可視化を備えた管理基盤を標準装備し、次々と世代交代するAIモデルを、業務を止めずに比較・切替できる状態でお渡しします。この設計と基盤は、当社自身が自社の営業DX基盤で本番運用してきたものです。
そのお悩み、スパイスファクトリーで解決しませんか?
Issue 01
PoCでは動いたが、
品質とセキュリティが本番に耐えない。
課題
デモは動いても、
稟議が通らない
本番データでは数字を間違える。プロンプトインジェクションで想定外の動作をする。誤った操作が実行されるリスクを説明できず、稟議が通りません。
転換
「LLMに何をさせないか」
を先に設計する
まず業務を分解し、各ステップを「決定論(コード)/LLM/人間」に仕分ける役割分担マップを作ります。
解決策
危険な経路から、
LLMを構造的に外す
数字はコードが集計し、確定操作は人の承認かコードの検証を必ず通す。本番に耐える品質とセキュリティを設計段階で担保します。
Issue 02
モデルの世代交代と運用に、
追従できない。
課題
切り替えるのが怖いまま、
塩漬けになる
作った時点で最適だった構成はすぐに古くなる。プロンプトを少し直しただけで挙動が変わり、誰も品質を保証できません。
仕組み
合格しない版は、
公開できない
プロンプト・モデル・パラメータを版として管理し、新しい版はゴールデンセットの評価に合格しない限り公開できません。防ぐのは注意力ではなく、コードです。
解決策
新モデルの登場が、
「配当」に変わる
評価ゲートと版管理を標準装備し、業務を止めずに比較・切替できる状態でお渡しします。新モデルは脅威ではなく、安全に取り込める配当になります。
Issue 03
何をAIに任せてよいか、
誰が責任を持つのかが決まらない。
課題
向き不向きも、
責任の所在も曖昧
どの業務が向いているのか判断できない。事故が起きたとき誰が止めるのかが曖昧で、情報システム部門・法務の承認が得られません。
設計
自律性は、
段階で設計する
「読み取る→下書く→承認付きで実行する→自律的に実行する」の段階で、どこから始め、何が確認できたら次へ進むかを設計します。
解決策
社内説明と監査に、
そのまま使える成果物
責任者・承認者・停止者・復旧者を定めた責任分界表、AIリスク台帳、停止・復旧設計を成果物として納品します。
AIエージェント開発について
もっと知りたい方は
オピニオン記事
AIエージェントは、「作って終わり」にできない 版管理・評価ゲート・コスト可視化——モデルが数ヶ月で入れ替わる時代の管理基盤を、自社実践から解説。 オピニオン記事を読む オピニオン記事を読む
ホワイトペーパー
AIエージェントを、PoCで終わらせない ハイブリッド設計の原則、自律性の設計、業務判定表・チェックリストに加え、費用の目安(価格レンジ)も収録。 資料を無料で申し込む 資料を無料で申し込む
無料相談
30分の適合性スクリーニングで、見立てをお持ち帰りください この業務は向いているか、止まっているPoCは本番化できるか。売り込みではなく、見立てをお返しする30分です。 無料相談を申し込む 無料相談を申し込む
Reason
選ばれる3つの理由
Feature01
決定論×LLMのハイブリッド設計。ハルシネーションを構造で封じる。
LLMの出力する数字を信じてよいか?——当社の答えは「数字はLLMに作らせない」です。集計・計算は決定論的なコードが実行し、LLMは意図の解釈と結果の言語化だけを担う。メール下書きなら、本文の生成はLLM、URLや署名の挿入はシステム側です。
外部から来るテキストは「命令ではなく信頼できないデータ」として区切って扱い、最小権限・出力の検証・人間承認・攻撃ケース評価を重ねる多層防御で、プロンプトインジェクションの影響を抑えます。
この設計思想と実装パターンの詳細は、オピニオン記事「LLMに数字を作らせない」で公開しています。
Feature02
評価駆動の開発と運用。ゴールデンセットが品質を守る。
構築の最初期に、正常系・境界ケース・攻撃ケース(プロンプトインジェクション等)を含むゴールデンセットをお客様の業務有識者と共同で作成します。これが受入基準となり、以後すべての版はこの評価に合格しない限り本番に出られません。
リリース後も、リスクに応じて評価の濃淡を使い分けながら、現場のフィードバックを評価ケースへ還流し続けます。作った瞬間がピークではなく、使うほど良くなるエージェントに育てます。
管理基盤の考え方は、オピニオン記事「AIエージェントは『作って終わり』にできない」で公開しています。
Feature03
責任と運用まで設計する。監査できて、止められる。
エージェントには最小権限を与え、すべての実行を監査ログに残し、いつでも止められるkill switchを備えます。
導入時には、責任者・承認者・停止者・復旧者を定めた責任分界表(Human-Agent Operating Model)と、OWASP LLM Top 10 や経産省AI事業者ガイドライン等を参照したAIリスク台帳を納品。「事故が起きたらどうするのか」に、仕組みと文書の両方で答えられる状態を作ります。
運用フェーズでは品質・コストの監視からモデル更改までを引き受け、ご希望に応じて内製化への移管も伴走します。
AIエージェント開発について
もっと知りたい方は
オピニオン記事
AIエージェントは、「作って終わり」にできない 版管理・評価ゲート・コスト可視化——モデルが数ヶ月で入れ替わる時代の管理基盤を、自社実践から解説。 オピニオン記事を読む オピニオン記事を読む
ホワイトペーパー
AIエージェントを、PoCで終わらせない ハイブリッド設計の原則、自律性の設計、業務判定表・チェックリストに加え、費用の目安(価格レンジ)も収録。 資料を無料で申し込む 資料を無料で申し込む
無料相談
30分の適合性スクリーニングで、見立てをお持ち帰りください この業務は向いているか、止まっているPoCは本番化できるか。売り込みではなく、見立てをお返しする30分です。 無料相談を申し込む 無料相談を申し込む
よくあるご質問
Copilot Studio や Agentforce など、既存プラットフォームのエージェント機能との違いは何ですか?
既存プラットフォームは、そのSaaSが持つデータと権限の範囲では強力な選択肢です。一方、複数システムを横断する業務、自社固有の業務ルールや承認フロー、確定処理の厳密な作り込みが必要な業務は、プラットフォームの枠内では実現が難しい領域です。当社はその領域を、ハイブリッド設計と管理基盤で本番運用まで引き受けます。既存プラットフォームで足りる要件だと判断した場合は、その旨を診断段階で率直にお伝えします。
他社で開発したPoCの相談もできますか?
できます。「PoC本番化診断」は他社開発・内製を問わず持ち込み可能です。作り直しありきではなく、活かせる資産と直すべき構造を仕分けたうえで本番化の道筋を提示します。
特定のAIモデルやクラウドにロックインされませんか?
特定モデルへの依存を抑える設計を標準とします。プロンプト・評価ケース・監査ログは移管可能な形式で管理し、評価ゲートを備えているため、より良いモデルが登場した際は安全に比較・切替できます。基盤自体も、お客様のクラウド環境への展開や既存製品(クラウドベンダーのエージェント基盤・LLMOps製品)との統合を選択でき、内製化移管まで見据えた構成にします。対応するモデル・クラウド・移管の範囲は、案件の要件に応じて個別に合意します。
社内データが整備されていなくても始められますか?
アセスメントの中でデータレディネス(データ品質・権限・API有無)を診断します。エージェント導入より先にデータ整備が必要と判断した場合は、無理にエージェント開発を進めず、データ整備・API化を先行するプランをご提案します。
セキュリティや監査への説明はどうなりますか?
最小権限・監査ログ・停止手段(kill switch)を実装で担保し、責任者・承認者・停止者・復旧者を定めた責任分界表とAIリスク台帳を納品します。OWASP LLM Top 10 や経産省のAI事業者ガイドライン等を参照した対応表により、情報システム部門・法務・監査への説明にそのまま使えます。
どのような業務がAIエージェントに向いていますか?
判断の物差しは「間違えたときのダメージ」と「曖昧さの度合い」です。曖昧さの処理(自然言語の解釈・非定型入力)を含み、かつ確定操作を人の承認やコードの検証で守れる業務が適しています。完全自律で確定操作まで任せる構成は初手では推奨せず、「読み取り→下書き→承認付き実行」と段階的に自律性を上げる設計をとります。ダウンロード資料に業務判定表を収録していますので、ご活用ください。
費用はどのくらいかかりますか?
業務の範囲・自律性のレベル・接続するシステムにより異なるため、個別にお見積りします。アセスメント・診断は小さく始められる価格設定です。費用の目安(価格レンジ)はダウンロード資料「AIエージェント実践ガイド」に掲載していますので、あわせてご覧ください。
小さく試すことはできますか?
できます。すべてのメニューは段階ごとに完結し、各段階の終わりに継続・撤退を判断いただけます。アセスメントの結果「導入しない」という結論になった場合も、役割分担マップやリスク台帳は今後の投資判断の資産として残ります。