1. Self-Hosted AI: the LLM concepts you need to run models effectively

개요

로컬 환경에서 LLM을 효과적으로 실행하기 위한 핵심 개념과 용어를 설명합니다.

주요 내용

* LLM(Large Language Model): 방대한 텍스트 데이터로 학습되어 언어를 이해하고 생성하는 머신러닝 모델이며, 뉴럴 네트워크 기반의 트랜스포머 구조를 가집니다.
* 추론(Inference): 학습된 LLM을 사용하여 답변을 생성하는 과정으로, 사용자의 하드웨어에서 실행됩니다.
* 서버(Server): LLM 모델 파일을 로드하고 실행하는 소프트웨어(예: Ollama, LM Studio)이며, 외부 애플리케이션과의 통신을 위해 로컬 API를 제공합니다.
* API(Application Programming Interface): 두 소프트웨어 조각이 통신할 수 있도록 하는 규칙의 집합으로, 로컬 API는 localhost 주소를 통해 접근 가능합니다.
* GPU, VRAM, RAM: 모델 실행 속도에 결정적인 영향을 미치며, GPU의 고속 메모리인 VRAM에 모델의 가중치(weights)를 로드하는 것이 중요합니다.
* 파라미터(Parameters): 모델이 학습 과정에서 얻은 내부 변수로, 예측에 사용되는 패턴을 저장하며, 파라미터 수가 많을수록 모델이 더 강력하지만 무겁고 느립니다.
* 모델 이름: 패밀리/버전(예: Llama 3.1), 크기(예: 8B), 양자화(quantization) 정보 등을 포함할 수 있습니다.
* 기본 모델(Base Model) vs. Instruct 모델: 기본 모델은 다음 단어 예측에 특화되어 있으며, Instruct 모델은 지시를 따르고 대화를 수행하도록 추가 튜닝된 모델입니다.
* 양자화(Quantization): 모델의 정밀도를 낮춰 파일 크기를 줄이고 메모리 사용량을 감소시켜, 모델을 더 빠르고 저렴한 하드웨어에서 실행할 수 있게 하는 기법입니다.
* GGUF 및 Safetensors: GGUF는 양자화된 모델을 단일 파일로 패키징하며 Ollama와 LM Studio의 네이티브 형식이고, Safetensors는 Hugging Face에서 주로 사용하는 전체 정밀도 가중치 형식입니다.
* 토큰(Token): 모델이 처리하는 텍스트의 가장 작은 단위로, 단어, 단어의 일부, 또는 구두점 등이 될 수 있습니다.
* 컨텍스트 창(Context Window): 모델이 한 번에 고려할 수 있는 텍스트의 양(토큰 단위)이며, 시스템 프롬프트, 대화 내용 등을 포함합니다.
* 온도(Temperature): 생성되는 텍스트의 무작위성을 제어하며, 낮은 값은 예측 가능성을 높이고 높은 값은 창의성을 높입니다.
* GPU 오프로드(GPU Offload): 모델의 레이어 중 GPU에서 처리하는 비율을 의미하며, 모든 레이어를 VRAM에 올리는 것이 가장 빠릅니다.
* LLM Model VRAM Calculator: 모델, 양자화, 컨텍스트 크기를 입력하여 하드웨어 호환성을 확인하는 도구입니다.
* 모델의 능력: 채팅/텍스트 생성, 비전(이미지 입력), 도구 사용(함수 호출), 추론, 구조화된 출력(JSON 등), 코드 완성(fill-in-the-middle), 임베딩(embedding) 등이 있습니다.
* 지식 마감 시점(Knowledge Cutoff) 및 환각(Hallucination): 모델의 학습 데이터 시점으로 인해 최신 정보에 대해 알지 못하거나, 사실이 아닌 정보를 자신감 있게 생성하는 현상입니다.
* 로컬 vs. 클라우드: 로컬 모델은 프라이버시와 비용 면에서 유리하며, 클라우드 모델은 뛰어난 성능, 큰 컨텍스트 창, 최신 정보 접근성 면에서 강점을 가집니다.

시사점

로컬 환경에서 LLM을 실행하기 위한 기본 개념을 이해하는 것은 프라이버시를 유지하면서 AI 모델을 효과적으로 활용하고, 다양한 애플리케이션과 워크플로우에 통합하는 데 필수적입니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions