프롬프트의 구조

"프롬프트 엔지니어링"을 인프라 분야로 재구성

프롬프트 구조는 스토리지 아키텍처와 LLM 추론 및 RAG의 서비스 품질 요구 사항에 영향을 미치는 상태 객체를 체계적으로 생성합니다.

이 백서는 프롬프트 레이어를 상태 객체(KV 캐시 블록, 검색 페이로드 및 도구 아티팩트), I/O 패턴, 주요 SLO 및 계층 배치 결정과 연결하는 매핑 아티팩트를 제공하여 "프롬프트 엔지니어링"을 인프라 분야로 재구성합니다. 

두 가지 조달 수준의 의미는 다음과 같습니다. 

  1. 긴 컨텍스트와 에이전트 워크플로우는 동시성 환경에서 KV 확장을 통해 "세션당 GB"를 "플릿당 TB"로 전환하며, 
  2. RAG는 높은 대기열 깊이에서의 헤드라인 IOPS가 아닌 p99/p99.9 지연 시간이 최종 사용자의 첫 번째 토큰 생성 시간을 결정하는 낮은 대기열 깊이의 무작위 읽기 워크로드처럼 작동합니다.

프로덕션 프롬프트는 정책, 템플릿, 사용자 의도, 세션 기록, 검색된 증거, 도구 스키마 및 도구 출력과 같은 컴파일된 컨텍스트 번들입니다. 특정 모델 및 서빙 스택에 대해 프롬프트 구조는 어떤 상태 객체(KV 캐시 블록, 검색 페이로드, 도구 아티팩트)가 인스턴스화되고 어떻게 확장되는지 결정합니다. 

이러한 상태 객체는 측정 가능한 I/O 형태 및 QoS 요구 사항을 부과합니다. 컨텍스트 창이 확장되어(일부 모델은 100만 토큰 창 제공) 사전 채우기 작업과 상태 공간이 증가합니다.1 긴 컨텍스트와 에이전트 루프는 상태를 증가시키고 동시성은 이를 배가시킵니다. 

  • KV 캐시는 지배적인 진행 중 작업 세트가 되며 TTFT, ITL 안정성 및 비용에 대한 일차적 제한 요소가 됩니다.2,3,4 
  • RAG는 동시성 환경에서 낮은 대기열 깊이의 무작위 읽기 워크로드처럼 작동합니다. 
  • 조달 성공은 높은 대기열 깊이에서의 최대 IOPS 또는 최대 GB/s가 아니라 현실적인 동시성 및 혼합 부하에서 QD1-4의 p99/p99.9 지연 시간에 의해 정의됩니다.5,6,7 

프롬프트에 대규모 안정 접두사, 기반 규칙, 도구 스키마 및 검색 페이로드가 포함된 경우, 암묵적으로 계층화 설계 및 동시성 하의 꼬리 지연 시간 요구 사항을 선택하는 것입니다. 

자세한 내용은 아래의 전체 백서를 읽어보십시오.


저자 소개

Jeff Harthorn은 Solidigm의 AI 응용 연구 책임자입니다. 그의 작업은 추론, 컨텍스트 메모리 및 데이터 파이프라인 설계에 중점을 두고 AI 워크로드와 스토리지 아키텍처 간의 관계에 초점을 맞춥니다. Jeff는 응용 연구, 벤치마킹 및 기술 스토리텔링을 결합하여 복잡한 인프라 주제를 고객, 파트너 및 고위 경영진을 위한 실행 가능한 통찰력으로 전환합니다. 그는 캘리포니아 주립 대학교 새크라멘토 캠퍼스에서 컴퓨터 공학 학사 학위를 받았습니다.

참조

1) Google, "Long context," Gemini API 문서 (Google AI for Developers). 사용 가능: https://ai.google.dev/gemini-api/docs/long-context (2026년 2월 24일 액세스). (Google AI for Developers

2) NVIDIA, "Accelerate Large-Scale LLM Inference and KV Cache Offload with CPU-GPU 

Memory Sharing," NVIDIA Technical Blog (2025년 9월 5일). 사용 가능: https://developer.nvidia.com/blog/accelerate-large-scale-llm-inference-and-kv-cache-offload-with-cpu-gpu-memory-sharing/ (2026년 2월 24일 액세스). (NVIDIA Developer)

3) Hugging Face, "KV cache strategies," Transformers 문서 (v4.55.4). 사용 가능: https://huggingface.co/docs/transformers/v4.55.4/en/kv_cache (2026년 2월 24일 액세스). (Hugging Face)

4) W. Kwon, et al., "Efficient Memory Management for Large Language Model Serving with PagedAttention," arXiv:2309.06180. 사용 가능: https://arxiv.org/abs/2309.06180 (2026년 2월 24일 액세스). (arXiv)

5) J. Dean and L. A. Barroso, "The Tail at Scale," Communications of the ACM, vol. 56, pp. 74–80 (2013년). 사용 가능: https://research.google/pubs/the-tail-at-scale/ (2026년 2월 24일 액세스). (Google Research)

6) Intel, "Performance Benchmarking for PCIe* and NVMe* Enterprise Solid-State Drives," 백서 (2015년 2월). 사용 가능: https://www.intel.com/content/dam/www/public/us/en/documents/white-papers/performance-pcie-nvme-enterprise-ssds-white-paper.pdf (2026년 2월 24일 액세스). (intel.com)

7) S.-H. Cho, et al., "Efficient Garbage Collection Algorithm for Low Latency SSD," Electronics, vol. 11, no. 7, 1084 (2022년). 사용 가능: https://www.mdpi.com/2079-9292/11/7/1084 (2026년 2월 24일 액세스). (MDPI)