최근 보고된 GhostSplice 공격은 악성 MCP 서버가 공격 지시를 여러 채널로 쪼개 보냅니다. 이로 인해 AI 모델은 단일 유해 지시일 때 작동하는 안전 장치를 인식하지 못해 비밀정보를 유출시킵니다. 지시를 조각내 전달한 뒤 AI가 내부에서 이를 다시 조합해 실행하게 만들어 기존 프롬프트 인젝션 방어 체계를 우회하는 기법이죠.
GhostSplice: MCP 분할 지시 공격의 원리와 전제조건
MCP(Model Context Protocol)는 Anthropic이 2024년 11월에 내놓은 개방형 프로토콜입니다. AI 어시스턴트가 외부 도구 서버와 통신하는 방식을 표준화하는 게 목적이죠. 하지만 ASSET Research Group의 2026년 7월 연구 결과, 이 표준 프로토콜을 악용한 ‘GhostSplice’ 공격이 가능한 것으로 드러났습니다.
분할 지시 공격의 핵심은 AI 코딩 에이전트가 신뢰 경계를 우회하게 만드는 데 있습니다. 공격자는 악성 MCP 서버를 통해 유해한 지시를 한 번에 보내지 않고 여러 조각으로 나눠 전달합니다. AI 모델은 각 조각이 무해하다고 판단해 받아들이지만, 결과적으로 내부에서 이를 조합해 전체 악의적 지시를 실행하게 되죠.
이 공격이 성립하려면 두 가지 전제조건이 반드시 필요합니다.
- 개발자가 공격자가 구축한 악성 MCP 서버를 이미 연결한 상태여야 한다.
- AI 코딩 에이전트가 유출 대상 파일에 접근할 권한을 가지고 있어야 한다.
일반 프롬프트 인젝션과의 차이점 및 우회 메커니즘
일반적인 프롬프트 인젝션은 단일 입력값에 공격 지시를 섞어 모델의 시스템 프롬프트를 덮어쓰거나 무시하게 만듭니다. 그래서 최신 AI 모델들은 단일 입력 내의 유해 패턴을 감지하는 강력한 안전 장치를 갖췄습니다.
반면 GhostSplice 같은 분할 지시 공격은 몇 가지 차별점이 있습니다.
- 인지적 분산: 지시 사항이 서로 다른 채널이나 단계로 나뉘어 전달되어 모델의 필터링 시스템이 전체 맥락의 위험성을 즉각 파악하기 어렵습니다.
- 신뢰 체계 악용: MCP라는 표준 프로토콜로 도구 서버와 통신하는 구조를 활용하기 때문에 에이전트는 외부 서버 데이터를 신뢰할 가능성이 높습니다.
- 재조합 실행: 개별 조각으로는 안전해 보이는 지시들이 에이전트의 작업 메모리 안에서 조합되어 최종적으로 비밀정보 유출 같은 치명적인 동작으로 이어집니다.
실제 테스트 결과: 모델별 순종률 비교
ASSET Research Group은 11개 AI 모델을 대상으로 단일 지시와 분할 지시 상황에서의 순종률(공격 지시에 따라 행동하는 비율)을 시험했습니다. 결과는 명확했습니다. 지시를 분할해서 전달하자 AI 모델의 보안 장치가 현저히 무력화된 것입니다.
전체 11개 모델의 평균 순종률은 단일 지시 시 42%에서 분할 지시 시 82%로 2배 이상 뛰었습니다. 특히 일부 최신 모델은 단일 지시에는 완벽히 대응했는데도 분할 지시에는 완전히 굴복하는 극단적인 양상을 보였습니다.
| 테스트 대상 모델 | 단일 지시 순종률 | 분할 지시 순종률 | 변화 추이 |
|---|---|---|---|
| GPT-4o | 0% | 100% | 전면 우회 |
| Gemini 2.0 Flash | 0% | 100% | 전면 우회 |
| Llama 3.3 70B | 0% | 100% | 전면 우회 |
| 11개 모델 평균 | 42% | 82% | 약 2배 상승 |
관련 위협 사례: AI Sidebar 확장 프로그램의 악성 동작
MCP 분할 지시 공격 외에도 AI 개발 환경을 노리는 공급망 공격 사례가 계속 보고됩니다. 대표적인 예가 ‘AI Sidebar’ 확장 프로그램입니다.
이 확장 프로그램은 2026년 1월 Chrome Web Store에서 대화 내용 탈취 의혹으로 삭제됐지만, 2026년 8월 다시 등장해 기업 브라우저 환경에 도달하고 있다고 Netskope Threat Labs가 확인했습니다.
최신 버전인 v1.7.3.0의 주요 악성 동작은 다음과 같습니다.
- 애필리에이트 리디렉션: 업데이트 및 설치 제거 이벤트를 이용해 새 포그라운드 탭에 애필리에이트 링크를 여는 수익화 스키마를 탑재했습니다.
- 경쟁 조건 악용: Chrome 확장 프로그램 API의 uninstall URL 등록 과정에서 ‘last-writer-wins’ 경쟁 조건을 이용해 제거 시 동작을 제어합니다.
- 탐지 분류: Netskope는 이 프로그램을 Trojan.GenericFCA.Script.37952로 분류하고, Google CDN을 통해 유포되는 것을 감지해 차단했습니다.
AI 코딩 에이전트 환경 관리자를 위한 대응 방안
분할 지시 공격 같은 정교한 기법은 모델 자체의 안전 장치만으로 막기 어렵습니다. 인프라 수준의 통제와 엄격한 권한 관리가 필수죠.
- MCP 서버 연결 검증: 출처가 불분명하거나 검증되지 않은 MCP 서버를 에이전트에 연결하는 일은 엄격히 금지해야 합니다.
- 최소 권한 원칙 적용: AI 에이전트가 프로젝트 전체 파일에 접근하는 대신, 작업에 꼭 필요한 파일에만 접근할 수 있게 권한 범위를 제한해야 합니다.
- 브라우저 확장 프로그램 통제: AI Sidebar처럼 삭제 후 재등장하는 악성 확장 프로그램이 기업 내 엔드포인트에 설치되지 않도록 화이트리스트 기반 정책을 운영해야 합니다.
- 출력 데이터 모니터링: 에이전트가 외부 서버로 보내는 데이터에 API 키나 비밀번호 같은 민감 정보가 섞여 있는지 실시간으로 감시하는 DLP(데이터 유출 방지) 솔루션을 도입해야 합니다.