
Reflexio - オープンソースAIエージェント学習プラットフォーム
AIエージェントに経験的記憶を与え、再学習なしに毎回の対話から学ぶ

Reflexio とは?わかりやすい説明
Reflexio は AI エージェント向けの行動学習プラットフォーム です。サポートボット、コーディングアシスタント、社内エージェントを運用しているなら、同じミスが二度起きるのを見たことがあるはずです。誤った明細への返金、必須確認のスキップ、人が介入するまでループする——基盤モデルの再学習は遅く高コストで、一度きりのプロンプト修正は次のリリースで消えます。
Reflexio はエージェントの横に置き、実際の会話——ユーザーの修正、失敗したツール経路、成功した結果——を、次のメッセージ前にエージェントが取得する 読めるルール に変換します。重み更新も fine-tune キューもありません。ユーザーが一度修正すれば、その教訓は次の千回の類似セッションに適用でき、監査ログと、ルールが古くなったら消せるボタン付きです。
ベクトル検索とは異なり、Reflexio が抽出するのは 行動ルール であり、ユーザーの発言をそのままコンテキストに詰め込むものではありません。チームは各 learning を読み、書き換え、承認・却下できるため、コンプライアンスの痕跡や説明可能な判断が求められる本番環境に向いています。
エージェントの経験記憶 と考えてください。「ユーザーが何を言ったか」ではなく、「次回エージェントはどう行動を変えるべきか」です。
エージェント学習ループの仕組み
Reflexio は既存の LLM 呼び出しを軽量な publish → extract → retrieve ループで包みます:
- Publish — セッション後、エージェントが transcript、ツール呼び出し、結果シグナル(解決、修正、エスカレーション)を Reflexio に送ります。
- Extract — Reflexio が繰り返す失敗と成功を learnings に蒸留します。短く人間が読めるルールで、チームが書き換え・承認・却下できます。
- Retrieve — 次セッション開始時、最初のモデル呼び出し前に関連 learnings のみ注入し、トークンコストを抑えます。
Codex、Claude Code、Cursor 向けの ポータブル統合 skill から始めるか、Python SDK、REST API、CLI で同じループを接続してください。LangChain、AutoGen、CrewAI、カスタムスタックに対応しています。多くのチームは staging で少数セッションを publish し、最初の learnings を人手でレビューしてから本番トラフィックで retrieve を有効にし、誤ったルールの本番反映リスクを下げます。
Reflexio がログで行うこと
継続的な自己改善
会話ごとにフィードバック。Reflexio は繰り返し失敗するパターンを見つけ learnings に昇格し、新しいセッションが矛盾すると 古いルールを退役 させます——エージェントはローンチ日の挙動で凍結せず、ポリシー変更に追従します。
自己調整する learnings
各 learning は ライブでの影響 でスコア化:どのセッションで助け、どれで助けなかったか。Reflexio は悪いルールを永続させず、これらの事例から文言を改訂します。
評価と測定可能なインパクト
成功を定義——チケットクローズ、エスカレーションなし、タスク完了。Reflexio はその定義でセッションを採点し、結果をアクティブな learnings に紐づけ、変更が本当にユーザーに効いたか分かります。
レビュー、承認、即時取り消し
任意の learning を開いて根拠を確認。書き換え、承認、却下、削除。却下は retrieval から即座に外れます。 任意の承認必須モードは、人のサインなしでは learnings を本番に出せません——規制対象や顧客向けエージェントに重要です。
Reflexio が向いている人
向いている:
- 繰り返しトラフィックのある本番エージェント:サポート、営業、コーディングアシスタント、採用、社内 ops。
- モデル全体の再学習なしで 監査可能な行動変更 が必要なチーム。
- データを VPC、自社 DB、air-gapped 環境に置く必要がある組織。
向いていない:
- ほぼボリュームのない一度きりデモ——安定ルールには信号不足。
- 成功を定義できない、learnings をレビューしないチーム——古いルールが蓄積。
製品サイトは サポート、コーディングエージェント、営業アシスタント、データアナリスト、採用 ワークフローを一般的な起点として強調しています。ワークフローが反復可能で結果が判定できる(チケットクローズ、テスト合格など)なら、Reflexio は実トラフィックから実行可能な改善ルールを継続的に抽出できます。
Reflexio vs ベクトルメモリ
| 従来のベクトルメモリ | Reflexio |
|---|---|
| ユーザーが言ったことを保存 | エージェントがどう行動すべきかを学習 |
| モデルが取得するか不明な事実 | 読んで制御できるルール |
| メモリが助けたか判断しにくい | コントロール baseline 対比でセッション採点 |
| 悪いメモリの取り消しが遅い | 一度却下すれば retrieval から外れる |
Reflexio は もう一つの RAG 層ではありません。「次回エージェントはどう違って振る舞うべきか?」にガバナンスで答え、「ユーザーが一度言及したことは?」ではありません。
料金とプラン上限
2026 年 9 月時点、Reflexio は 公式料金ページ で次の tier を公開:
- Free — $0/月 — 月 100K input tokens、月 100 learnings 生成、月 1,000 search;アカウント有効中データ保持;30 日 Pro トライアル 含む;コミュニティサポート。
- Pro — $299/月 — 月 10M input tokens、月 10K learnings、月 100K search;優先サポート。
- BYOC self-hosted — カスタム — AWS、GCP、Azure で実行;データは自社インフラ;トークン使用量は自己管理;保持期間設定可;オンボーディングは営業へ。
メール、Google、GitHub で登録。デプロイ規模の相談はサイトで demo を予約。
デプロイとデータ制御
エージェントが呼ぶ API はモード間で同一:
- Managed — Reflexio が組織ごとに分離 schema でサービス運用。
- BYOK — OpenAI、Anthropic、DeepSeek、Qwen、xAI またはカスタム endpoint のキー。
- Your database — learnings を 自社 Supabase または Postgres に保存する managed サービス。
- BYOC — Reflexio が自社クラウドアカウント内で動作。
- Self-host — 自社管理インフラで single-tenant、Reflexio への接続なし——air-gapped やベンダー独立向け。
プラットフォームは要求に応じたユーザーデータ export/erase と、矛盾する learnings が挙動を drift させない背景の競合解決を文書化しています。
よくある質問
Reflexio は基盤モデルを再学習しますか?
いいえ。改善は runtime learnings——取得されるルールと嗜好——であり、新しいモデル重みではありません。ロールバックはルールを却下するだけです。
fine-tuning や RLHF との違いは?
fine-tuning と RLHF はモデル checkpoint を変えます。Reflexio は 本番からの行動修正 を捕捉し次セッションに適用、人の veto と deployment ごとの測定可能な impact 付き。
Reflexio を self-host できますか?
はい。コアは GitHub (ReflexioAI/reflexio) で Apache 2.0 オープンソース。Managed tier はホストの便利さを追加;データ residency 向けに BYOC と完全 self-host あり。
始めるには何が必要?
無料アカウント作成、統合経路選択(agent skill、Python SDK、REST、CLI)、最初のセッション publish、抽出 learning レビュー、次 run で retrieval 有効化。ドキュメント で SDK/CLI 参照。
Reflexio はチャットボット専用?
いいえ。返金、コード編集、CRM 更新など 繰り返しワークフローのツール利用エージェント なら誰でもセッション publish と learnings 取得が可能。マルチステップエージェント向けで、単一ターン FAQ ボットだけではありません。





