도구 매뉴얼 · 비개발자용

llama.cpp — 내 컴퓨터에서 AI를 직접 돌리는 '엔진'

llama.cpp는 인터넷 없이 내 컴퓨터(고성능 그래픽카드가 없어도)에서 AI 언어모델을 직접 돌리게 해주는 C++ 엔진입니다. 무료 오픈소스(MIT)지만 터미널·빌드 같은 기술이 필요한 개발자용이라, 비개발자는 같은 기술을 쉽게 감싼 ollama로 시작하는 편이 낫습니다.

기준일: 2026-06-08난이도: 입문
먼저 답부터

llama.cpp는 내 컴퓨터에서 AI를 직접 돌리는 무료 엔진(MIT)이지만, 2026년 기준 개발자용이라 비개발자는 ollama가 더 쉽습니다.

What it is

0. llama.cpp가 뭔가요

내 컴퓨터에서 AI 언어모델을 직접 돌게 해주는 '속엔진'입니다.

Local LLM / on-device AI로컬 AI / 내 기기에서 돌리는 AI
AI 언어모델을 외부 서버가 아니라 내 컴퓨터 안에서 직접 실행하는 방식입니다. 인터넷이 끊겨도 쓸 수 있고, 입력 내용이 밖으로 나가지 않는다는 장점이 있습니다.
Inference engine추론 엔진
이미 학습이 끝난 AI 모델을 받아, 사용자의 질문에 답을 만들어 내는(추론하는) 부품입니다. llama.cpp가 바로 이 역할을 합니다.
Open source / MIT license오픈소스 / MIT 라이선스
코드가 공개돼 누구나 무료로 보고·쓰고·고칠 수 있는 방식입니다. MIT는 그중에서도 제약이 매우 적은, 가장 자유로운 축에 드는 허용형 라이선스입니다.
Why it matters

왜 이름이 자주 들릴까 — 그리고 '내 컴퓨터에서 AI 돌리기'란

비개발자가 직접 쓸 일은 드물지만, 알아두면 AI 흐름이 보입니다.

AI 소식을 듣다 보면 'llama.cpp'라는 이름이 자주 등장합니다. 직접 쓰지 않더라도, 왜 이게 중요한지 정도만 알면 요즘 AI 흐름을 이해하는 데 도움이 됩니다.

  • '내 컴퓨터에서 AI 돌리기'를 가능하게 한 도구 — 예전엔 좋은 AI를 쓰려면 비싼 서버나 고성능 그래픽카드(GPU)가 필요했습니다. llama.cpp는 평범한 노트북·PC에서도, 심지어 GPU 없이 일반 CPU만으로도 작은 모델이라면 돌아가게 만들어, AI를 '내 기기에서' 쓰는 길을 크게 넓혔습니다.
  • 쉬운 도구들의 '속엔진' — 비개발자가 쓰기 쉬운 ollama 같은 로컬 AI 도구들이 내부에서 바로 이 llama.cpp 엔진을 활용합니다. 즉 우리가 쉬운 앱을 클릭할 때, 보이지 않는 곳에서 이 부품이 일하고 있는 셈입니다.
  • 무료·오픈소스라 모두가 손본다 — 공식 저장소 기준 MIT 라이선스라 누구나 무료로 쓰고 고칠 수 있어, 전 세계 개발자가 함께 개선합니다. 그래서 발전이 빠르고 자주 화제가 됩니다.

핵심은 이렇습니다. 이름은 자주 들리지만, 비개발자가 이 엔진을 직접 만질 일은 드뭅니다. '아, 내 컴퓨터에서 AI를 돌리게 해주는 무료 엔진이고, 쉬운 도구들의 속재료구나' 정도로 이해하면 충분합니다.

흔한 오해

내 컴퓨터에서 AI를 돌리면 ChatGPT보다 무조건 좋은 거 아닌가요?

실제로는

꼭 그렇진 않습니다. 인터넷 없이 쓰고, 입력이 밖으로 안 나가는 건 장점이에요. 하지만 내 컴퓨터에서 돌릴 수 있는 모델은 보통 ChatGPT 같은 최신 대형 모델보다 작고 성능이 낮은 편이라, 답 품질이 떨어질 수 있습니다. '개인정보를 외부에 안 보내고 싶다'처럼 분명한 이유가 있을 때 빛을 봅니다.

Is it for me

나한테 직접 필요한 도구일까 (대개 아님)

솔직히, 비개발자가 첫 도구로 llama.cpp를 고를 이유는 거의 없습니다.

llama.cpp는 개발자, 또는 글자 명령(터미널)과 프로그램 빌드가 익숙한 사람을 위한 도구입니다. 비개발자에게는 직접 쓸 이유보다 '이런 게 있다'고 아는 의미가 더 큽니다. 시작 전에 솔직히 알아둘 문턱은 이렇습니다.

  • 터미널을 써야 합니다 — 마우스 클릭이 아니라 글자 명령으로 설치·실행합니다. 공식 빌드 문서의 모든 안내가 명령 입력 기준입니다.
  • 빌드(조립)가 필요할 수 있습니다 — 공식 빌드 문서 기준, 코드를 받아 직접 '빌드'(소스를 프로그램으로 조립)하는 흐름이 기본입니다. 이때 CMake, C++ 컴파일러, Git 같은 개발 도구가 필요합니다. 미리 만들어진 실행 파일(prebuilt)을 받는 길도 있지만, 그 역시 터미널 사용이 전제입니다.
  • 모델 파일을 따로 구해야 합니다 — 엔진만으론 답을 못 합니다. 'GGUF'라는 형식의 AI 모델 파일을 별도로 내려받아 넣어줘야 작동합니다.

그래서 '내 컴퓨터에서 로컬 AI를 써보고 싶다'면, 같은 엔진을 마우스 위주로 쉽게 감싼 ollama로 시작하는 게 정답에 가깝습니다. llama.cpp는 그걸로 충분치 않거나 세부를 직접 손봐야 할 때 찾는 도구입니다.

이런 분은 보류

로컬 AI를 '편하게' 써보고 싶은 분

그냥 내 컴퓨터에서 AI를 한번 돌려보고 싶은 정도라면 llama.cpp를 직접 만질 필요가 없습니다. 마우스 위주로 쉽게 쓰는 ollama가 훨씬 빠른 입구입니다.

이런 분께만 권함

터미널·빌드가 익숙한 분

명령 입력과 프로그램 빌드가 편하고, 모델·성능 옵션을 세밀히 조절하고 싶은 분에게 맞습니다. 이 정도가 부담되면 아직은 보류가 정직한 답입니다.

What it does

무엇을 해주나 — 장단점 한눈에

강력하고 가볍지만, 손이 많이 간다는 게 정직한 요약입니다.

공식 저장소 기준, llama.cpp가 잘하는 일과 한계를 비개발자 눈높이로 정리하면 다음과 같습니다. 표는 변동될 수 있으니 큰 흐름으로만 봐주세요.

항목내용 (2026-06-08 기준, 변동 가능)
핵심 기능내 컴퓨터에서 AI 언어모델을 직접 돌려 답을 만들어 줌(로컬 추론)
필요 장비고성능 그래픽카드(GPU)가 있으면 빠르지만, 없어도 일반 CPU로 작은 모델은 작동
지원 기기맥(애플 실리콘)·윈도우·리눅스 등 폭넓게 지원(공식 README 기준)
비용·라이선스무료 오픈소스(MIT) — 누구나 자유롭게 쓰고 고칠 수 있음(공식 확인)
쓰는 방식터미널 명령 위주. 서버 모드로 켜면 브라우저(localhost)에서 간단한 화면 사용도 가능
진입 문턱설치·빌드에 터미널·개발 도구 필요 → 비개발자에겐 높음(쉬운 길은 ollama)
How it works

이해해 보기 — '로컬 AI'가 돌아가는 흐름

직접 설치하지 않더라도, 이 4단계 흐름만 알면 개념이 잡힙니다.

  1. 1단계 · 엔진을 준비한다

    먼저 답을 만들어 줄 '엔진'(llama.cpp)을 컴퓨터에 올립니다. 개발자는 코드를 받아 직접 빌드(조립)하거나 미리 만들어진 실행 파일을 받습니다. 비개발자라면 이 과정을 대신 처리해 주는 ollama가 훨씬 편합니다.

  2. 2단계 · AI 모델 파일을 구한다

    엔진만으론 답을 못 합니다. 'GGUF'라는 형식의 AI 모델 파일(엔진에 넣을 두뇌)을 따로 내려받아야 합니다. 모델은 크기가 다양해, 작을수록 가볍게 돌고 클수록 똑똑하지만 무겁습니다.

  3. 3단계 · 엔진에 모델을 얹어 실행한다

    터미널에서 엔진에 모델 파일을 지정해 실행합니다. 이때부터 인터넷 없이도 내 컴퓨터 안에서 AI가 동작합니다. 입력한 내용이 외부로 나가지 않는 게 로컬 AI의 핵심 장점입니다.

  4. 4단계 · 질문하고 답을 받는다

    터미널에 직접 묻거나, 서버 모드로 켜서 브라우저(localhost) 화면으로 대화합니다. 답 품질은 얹은 모델 크기·내 컴퓨터 성능에 따라 달라지며, 받은 답은 한 번 확인하고 쓰는 게 좋습니다.

Start now

오늘 해볼 것 — 설치 말고 '판단'부터

꼭 설치하지 않아도 됩니다. 나에게 필요한지부터 가볍게 가늠해 보세요.

  1. 1단계 · 공식 저장소 둘러보기

    github.com/ggml-org/llama.cpp 를 열어 '무엇을 하는 엔진인지' 소개를 훑어봅니다. 영어가 부담되면 브라우저 번역을 켜세요. 라이선스(MIT) 표기도 이곳에서 확인할 수 있습니다.

  2. 2단계 · 내게 직접 필요한지 자문하기

    '나는 터미널·빌드를 시도할 의향이 있나?', '꼭 엔진을 직접 손봐야 하나?' 스스로 답해 봅니다. 둘 다 아니라면 다음 단계로 가세요.

  3. 3단계 · 로컬 AI가 궁금하면 ollama로

    '내 컴퓨터에서 AI 돌리기'가 궁금하다면 llama.cpp 대신 ollama 매뉴얼(도구 탭)을 먼저 봅니다. 같은 일을 훨씬 쉽게 체험할 수 있습니다.

  4. 4단계 · 그래도 충분하면 챗봇으로

    로컬 AI에 특별한 필요가 없다면 ChatGPT·Claude 같은 웹 챗봇으로 충분합니다. 나중에 개인정보 보호 등 분명한 이유가 생기면 그때 로컬 AI로 와도 늦지 않습니다.

  1. 공식 저장소에서 'MIT 라이선스·지원 기기' 표기를 직접 한 번 확인하기
  2. 직접 설치를 생각한다면, 명령은 기억에 의존하지 말고 공식 빌드 문서에서 그대로 복사하기
  3. 로컬 AI가 처음이라면 llama.cpp 대신 ollama부터 가볍게 체험하기

이걸 했으면 첫걸음 끝

  • llama.cpp가 '내 컴퓨터에서 AI를 돌리는 무료 엔진'이라는 걸 이해했다
  • 이게 개발자용이고, 비개발자 쉬운 길은 ollama임을 알았다
  • 공식 저장소에서 라이선스(MIT)·지원 기기를 한 번 확인했다
  • 나에게 로컬 AI가 정말 필요한지 스스로 판단해 봤다

자주 묻는 질문

llama.cpp는 무료인가요?

네, 공식 저장소 기준 MIT 라이선스의 무료 오픈소스라 누구나 자유롭게 쓰고 고칠 수 있습니다. 다만 '무료'와 '쉬움'은 다릅니다. 설치·빌드에 터미널과 개발 도구가 필요해 비개발자에겐 문턱이 있습니다. 라이선스 표기는 바뀔 수 있으니 중요하면 공식에서 한 번 더 확인하세요.

코딩을 전혀 모르는데 쓸 수 있나요?

권장하지 않습니다. 설치·실행에 글자 명령(터미널)과 프로그램 빌드가 필요해 비개발자에겐 어렵습니다. '내 컴퓨터에서 AI 돌리기'가 궁금하다면, 같은 엔진을 쉽게 감싼 ollama로 시작하는 게 훨씬 편합니다.

ollama랑 뭐가 다른가요?

llama.cpp는 AI를 돌리는 '엔진(부품)'이고, ollama는 그 엔진을 쉽게 감싸 누구나 쓰게 만든 '완성품'에 가깝습니다. 비개발자는 보통 ollama를 쓰고, llama.cpp는 세부를 직접 손봐야 하는 개발자가 찾습니다.

고성능 그래픽카드(GPU)가 꼭 있어야 하나요?

아닙니다. 공식 저장소 기준 GPU가 있으면 더 빠르지만, 없어도 일반 CPU만으로 작은 모델은 돌릴 수 있습니다. 다만 모델이 크고 컴퓨터가 느리면 답이 느리게 나올 수 있습니다.

내 컴퓨터에서 돌리면 ChatGPT보다 똑똑한가요?

대체로 그렇지 않습니다. 내 컴퓨터에서 돌릴 수 있는 모델은 보통 최신 대형 모델보다 작아 답 품질이 낮을 수 있습니다. 대신 인터넷 없이 쓰고 입력이 밖으로 안 나간다는 장점이 있어, 개인정보 보호가 중요할 때 유용합니다.

AI 답이 항상 맞나요?

아닙니다. 로컬에서 돌린 작은 모델은 특히 사실을 틀리거나 지어낼 수 있습니다. 사실·숫자·이름이 든 답은 그대로 믿지 말고 한 번 직접 확인하는 습관을 들이세요.

출처와 확인 경계

기능·지원 기기·라이선스(MIT)·설치 방식은 llama.cpp 공식 GitHub 저장소와 공식 빌드 문서(README·docs/build.md)를 기준으로 정리했습니다(2026-06-08 기준). 화면 안내, 설치·빌드 명령, 지원 기기 목록, 라이선스 표기는 업데이트로 바뀔 수 있으니 아래 내용은 큰 흐름으로 참고하고, 실제로 진행하기 전 공식 저장소에서 최신 정보를 한 번 확인하세요. 또 AI가 만든 답·결과가 항상 맞는 것은 아니므로, 받은 결과는 그대로 믿기보다 사실·숫자·이름을 한 번 직접 확인하는 게 좋습니다.