
Reflexio - 오픈소스 AI 에이전트 학습 플랫폼
AI 에이전트에 경험적 메모리를 부여하고 재훈련 없이 모든 대화에서 학습

Reflexio란? 쉬운 설명
Reflexio는 AI 에이전트를 위한 행동 학습 플랫폼입니다. 지원 봇, 코딩 어시스턴트, 내부 에이전트를 운영한다면 같은 실수가 두 번 반복되는 것을 봤을 겁니다. 잘못된 항목 환불, 필수 확인 건너뛰기, 사람이 개입할 때까지 루프——파운데이션 모델 재학습은 느리고 비쌉니다. 일회성 프롬프트 수정은 다음 릴리스에서 사라집니다.
Reflexio는 에이전트 옆에 두고 실제 대화——사용자 수정, 실패한 도구 경로, 성공 결과——를 다음 메시지 전에 에이전트가 가져올 읽을 수 있는 규칙으로 바꿉니다. 가중치 업데이트도 fine-tune 대기열도 없습니다. 사용자가 한 번 수정하면 그 교훈이 다음 수천 번의 유사 세션에 적용될 수 있고, 감사 추적과 규칙이 낡으면 지울 버튼이 있습니다.
에이전트의 경험 기억으로 생각하세요. «사용자가 뭐라고 했는지»가 아니라 «다음에 에이전트가 어떻게 다르게 행동해야 하는지»입니다.
에이전트 학습 루프 작동 방식
Reflexio는 기존 LLM 호출을 가벼운 publish → extract → retrieve 루프로 감쌉니다:
- Publish — 세션 후 에이전트가 transcript, 도구 호출, 결과 신호(해결, 수정, 에스컬레이션)를 Reflexio에 보냅니다.
- Extract — Reflexio가 반복되는 실패와 성공을 learnings으로 정제합니다. 팀이 다시 쓰고, 승인하고, 거부할 수 있는 짧고 읽기 쉬운 규칙입니다.
- Retrieve — 다음 세션 시작 시 첫 모델 호출 전에 관련 learnings만 주입해 토큰 비용을 낮춥니다.
Codex, Claude Code, Cursor용 휴대용 통합 skill로 시작하거나 Python SDK, REST API, CLI로 같은 루프를 연결하세요. LangChain, AutoGen, CrewAI, 커스텀 스택을 지원합니다.
Reflexio가 로그로 하는 일
지속적 자기 개선
모든 대화가 피드백됩니다. Reflexio는 계속 실패하는 패턴을 찾아 learnings로 승격하고, 더 새로운 세션이 모순하면 구 규칙을 은퇴시킵니다——에이전트는 출시일 행동에 고정되지 않고 정책 변경을 따릅니다.
자가 조정 learnings
각 learning은 라이브 영향으로 점수화: 어떤 세션에 도움이 됐고 어떤 세션에는 아닌지. Reflexio는 나쁜 규칙을 영원히 두지 않고 이런 사례에서 문구를 수정합니다.
평가와 측정 가능한 임팩트
성공을 정의——티켓 종료, 에스컬레이션 없음, 작업 완료. Reflexio는 그 정의로 세션을 채점하고 결과를 활성 learnings에 연결해 변경이 정말 사용자에게 도움이 됐는지 알 수 있습니다.
검토, 승인, 즉시 철회
learning을 열어 근거를 확인하세요. 다시 쓰고, 승인하고, 거부하고, 삭제하세요. 거부는 retrieval에서 즉시 제거됩니다. 선택적 승인 필수 모드는 사람 서명 없이 learnings가 라이브에 나가지 못하게 합니다——규제·고객 대면 에이전트에 중요합니다.
Reflexio가 적합한 대상
적합:
- 반복 트래픽의 프로덕션 에이전트: 지원, 영업, 코딩 어시스턴트, 채용, 내부 ops.
- 전체 모델 재학습 없이 감사 가능한 행동 변경이 필요한 팀.
- 데이터를 VPC, 자체 DB, air-gapped 환경에 둬야 하는 조직.
부적합:
- 거의 볼륨 없는 일회성 데모——안정 규칙에 신호 부족.
- 성공을 정의 못 하거나 learnings를 never 검토하는 팀——낡은 규칙 누적.
제품 사이트는 지원, 코딩 에이전트, 영업 어시스턴트, 데이터 분석가, 채용 워크플로를 흔한 시작점으로 강조합니다.
Reflexio vs 벡터 메모리
| 전통적 벡터 메모리 | Reflexio |
|---|---|
| 사용자가 말한 것 저장 | 에이전트가 어떻게 행동해야 하는지 학습 |
| 모델이 가져올지 불확실한 사실 | 읽고 제어할 수 있는 규칙 |
| 메모리가 도움이 됐는지 알기 어려움 | control baseline 대비 세션 채점 |
| 나쁜 메모리 되돌리기 느림 | 한 번 거부하면 retrieval에서 빠짐 |
Reflexio는 또 하나의 RAG 레이어가 아닙니다. «다음에 에이전트는 어떻게 다르게 행동해야 하나?»에 거버넌스로 답하고, «사용자가 한 번 언급한 것은?»에 답하지 않습니다.
가격 및 플랜 한도
2026년 9월 기준 Reflexio는 공식 가격 페이지에 다음 tier를 게시합니다:
- Free — $0/월 — 월 100K input tokens, 월 100 learnings 생성, 월 1,000 search; 계정 활성 동안 데이터 보관; 30일 Pro 체험 포함; 커뮤니티 지원.
- Pro — $299/월 — 월 10M input tokens, 월 10K learnings, 월 100K search; 우선 지원.
- BYOC self-hosted — 맞춤 — AWS, GCP, Azure에서 실행; 데이터는 자체 인프라; 토큰 사용량 자체 관리; 보존 기간 설정 가능; onboarding은 영업 문의.
이메일, Google, GitHub로 가입. 배포 규모 상담은 사이트에서 demo 예약.
배포 및 데이터 제어
에이전트가 호출하는 API는 모드 간 동일:
- Managed — Reflexio가 조직별 격리 schema로 서비스 운영.
- BYOK — OpenAI, Anthropic, DeepSeek, Qwen, xAI 또는 커스텀 endpoint 키.
- Your database — learnings를 자사 Supabase 또는 Postgres에 저장하는 managed 서비스.
- BYOC — Reflexio가 클라우드 계정 내부에서 실행.
- Self-host — 자체 통제 인프라에서 single-tenant, Reflexio로의 연결 없음——air-gapped·벤더 독립 요구용.
플랫폼은 요청 시 사용자 데이터 export/erase와 상충 learnings가 시간에 따라 행동을 drift시키지 않도록 백그라운드 충돌 해결을 문서화합니다.
자주 묻는 질문
Reflexio가 파운데이션 모델을 재학습하나요?
아니요. 개선은 runtime learnings——가져온 규칙과 선호——이며 새 모델 가중치가 아닙니다. 롤백은 규칙 거부만큼 간단합니다.
fine-tuning이나 RLHF와 어떻게 다른가요?
fine-tuning과 RLHF는 모델 checkpoint를 바꿉니다. Reflexio는 프로덕션 행동 수정을 포착해 다음 세션에 적용하고, human veto와 deployment별 측정 가능한 impact가 있습니다.
Reflexio를 self-host할 수 있나요?
예. 코어는 GitHub (ReflexioAI/reflexio)에서 Apache 2.0 오픈소스. Managed tier는 호스팅 편의 추가; data residency용 BYOC·완전 self-host 옵션 있음.
시작하려면?
무료 계정 생성, 통합 경로 선택(agent skill, Python SDK, REST, CLI), 첫 세션 publish, 추출 learning 검토, 다음 run에서 retrieval 활성화. SDK·CLI 참조는 문서.
Reflexio는 챗봇 전용인가요?
아니요. 환불, 코드 편집, CRM 업데이트 등 반복 워크플로의 도구 사용 에이전트라면 누구나 세션 publish와 learnings retrieval 가능. multi-step 에이전트 대상이며 single-turn FAQ 봇만은 아닙니다.





