프롬프트 구조는 스토리지 아키텍처와 LLM 추론 및 RAG의 서비스 품질 요구 사항에 영향을 미치는 상태 객체를 체계적으로 생성합니다.
이 백서는 프롬프트 레이어를 상태 객체(KV 캐시 블록, 검색 페이로드 및 도구 아티팩트), I/O 패턴, 주요 SLO 및 계층 배치 결정과 연결하는 매핑 아티팩트를 제공하여 "프롬프트 엔지니어링"을 인프라 분야로 재구성합니다.
두 가지 조달 수준의 의미는 다음과 같습니다.
프로덕션 프롬프트는 정책, 템플릿, 사용자 의도, 세션 기록, 검색된 증거, 도구 스키마 및 도구 출력과 같은 컴파일된 컨텍스트 번들입니다. 특정 모델 및 서빙 스택에 대해 프롬프트 구조는 어떤 상태 객체(KV 캐시 블록, 검색 페이로드, 도구 아티팩트)가 인스턴스화되고 어떻게 확장되는지 결정합니다.
이러한 상태 객체는 측정 가능한 I/O 형태 및 QoS 요구 사항을 부과합니다. 컨텍스트 창이 확장되어(일부 모델은 100만 토큰 창 제공) 사전 채우기 작업과 상태 공간이 증가합니다.1 긴 컨텍스트와 에이전트 루프는 상태를 증가시키고 동시성은 이를 배가시킵니다.
프롬프트에 대규모 안정 접두사, 기반 규칙, 도구 스키마 및 검색 페이로드가 포함된 경우, 암묵적으로 계층화 설계 및 동시성 하의 꼬리 지연 시간 요구 사항을 선택하는 것입니다.
자세한 내용은 아래의 전체 백서를 읽어보십시오.
Jeff Harthorn은 Solidigm의 AI 응용 연구 책임자입니다. 그의 작업은 추론, 컨텍스트 메모리 및 데이터 파이프라인 설계에 중점을 두고 AI 워크로드와 스토리지 아키텍처 간의 관계에 초점을 맞춥니다. Jeff는 응용 연구, 벤치마킹 및 기술 스토리텔링을 결합하여 복잡한 인프라 주제를 고객, 파트너 및 고위 경영진을 위한 실행 가능한 통찰력으로 전환합니다. 그는 캘리포니아 주립 대학교 새크라멘토 캠퍼스에서 컴퓨터 공학 학사 학위를 받았습니다.
1) Google, "Long context," Gemini API 문서 (Google AI for Developers). 사용 가능: https://ai.google.dev/gemini-api/docs/long-context (2026년 2월 24일 액세스). (Google AI for Developers)
2) NVIDIA, "Accelerate Large-Scale LLM Inference and KV Cache Offload with CPU-GPU
Memory Sharing," NVIDIA Technical Blog (2025년 9월 5일). 사용 가능: https://developer.nvidia.com/blog/accelerate-large-scale-llm-inference-and-kv-cache-offload-with-cpu-gpu-memory-sharing/ (2026년 2월 24일 액세스). (NVIDIA Developer)
3) Hugging Face, "KV cache strategies," Transformers 문서 (v4.55.4). 사용 가능: https://huggingface.co/docs/transformers/v4.55.4/en/kv_cache (2026년 2월 24일 액세스). (Hugging Face)
4) W. Kwon, et al., "Efficient Memory Management for Large Language Model Serving with PagedAttention," arXiv:2309.06180. 사용 가능: https://arxiv.org/abs/2309.06180 (2026년 2월 24일 액세스). (arXiv)
5) J. Dean and L. A. Barroso, "The Tail at Scale," Communications of the ACM, vol. 56, pp. 74–80 (2013년). 사용 가능: https://research.google/pubs/the-tail-at-scale/ (2026년 2월 24일 액세스). (Google Research)
6) Intel, "Performance Benchmarking for PCIe* and NVMe* Enterprise Solid-State Drives," 백서 (2015년 2월). 사용 가능: https://www.intel.com/content/dam/www/public/us/en/documents/white-papers/performance-pcie-nvme-enterprise-ssds-white-paper.pdf (2026년 2월 24일 액세스). (intel.com)
7) S.-H. Cho, et al., "Efficient Garbage Collection Algorithm for Low Latency SSD," Electronics, vol. 11, no. 7, 1084 (2022년). 사용 가능: https://www.mdpi.com/2079-9292/11/7/1084 (2026년 2월 24일 액세스). (MDPI)