2026-09-27 — 로컬 LLM에 긴 문서를 넣고 요약·질문을 하려면 두 가지 시간이 걸립니다. 문서를 읽는 시간(프롬프트 처리)과, 읽은 뒤 답을 쓰는 속도(생성)입니다. 짧은 질문으로 잰 "41 tok/s" 같은 숫자에는 둘 다 드러나지 않습니다. GTX 1660 SUPER 6GB에…
2026-09-27 — 윈도우에서 winget install llama.cpp로 llama.cpp를 설치하면 Vulkan 빌드가 깔립니다. NVIDIA 그래픽카드에서도 잘 돌아가서 모르고 넘어가기 쉬운데, GTX 1660 SUPER 6GB에서 같은 모델 파일을 NVIDIA 전용 빌드로 돌려…
2026-09-26 — 질문은 두 가지를 썼습니다. 영어 질문 "Explain in about 200 words how quantization lets a large language model run on a GPU with 6GB of VRAM."과, 같은 뜻의 한국어 질문 "6GB 그래…
2026-09-26 — 같은 "초당 토큰 수"라도 한국어로 체감하는 속도는 모델마다 다릅니다. 모델마다 한국어 한 글자를 몇 토큰으로 쪼개는지가 달라서입니다. GTX 1660 SUPER 6GB에서 같은 한국어 질문으로 EXAONE 3.5, Gemma 3, Qwen3를 측정해 실제로 초당 몇…