지원 기기
폐폰에서도 같은 엔진이 돕니다
이름 한 줄은 서류 한 장보다 훨씬 짧습니다. 4GB 폐폰에 Termux 와 llama.cpp 를 올려 규칙이 못 푼 줄 30건을 모델에 맡기고 시간과 정답률을 잽니다. 폰은 실측 기기이지 서버가 아닙니다.
표의 숫자는 전부 bench/results/의 결과 파일에서 옵니다. 못 잰 칸은 「측정 예정」입니다.
기기
재는 기기 둘, 잴 기기 하나
갤럭시 A31 실측
SM-A315N · 2020년 · RAM 4GB · MediaTek Helio P65(Cortex-A55×6 + A75×2) · Android 12(One UI 4.1, 지원 종료) · Termux + pkg install llama-cpp python.
노트북 체험 인스턴스
Intel Core i7-10750H · 4스레드. 체험 사이트의 인스턴스와 미리 잰 기록이 이 기기 값입니다.
2013년 이전 PC 측정 예정
AVX 만 있는 구형 데스크톱. 실제로 쓰는 연식의 PC 를 구해 어느 연식까지 실용 속도가 나오는지 표로 만듭니다.
실측표
같은 스크립트 · 같은 30건 · 같은 명부
「확인 필요 줄」 30건은 가족 명의·회사 명의·오타·개명·종류+오타·모름 각 5건입니다. 규칙 1·2단이 먼저 걸러 남는 줄만 모델이 본다는 조건을 그대로 재현하고, 이력이 필요한 유형에는 과거 확정 이력을 줍니다. 정답이 없는 「모름」 5건은 relation 만 채점합니다.
| 기기 | 모델 | 스레드 | 줄당 초 | pp tok/s | tg tok/s | 후보 1위 정답 | 후보 3 안 | relation 정답 | JSON 성공 |
|---|---|---|---|---|---|---|---|---|---|
| 갤럭시 A31 (4GB) | Qwen2.5-1.5B-Instruct Q4_K_M | 8 | 111.5 (97.3~135.6) | 8.9 | 4.5 | 12/25 (48%) | 13/25 (52%) | 11/30 (37%) | 30/30 (100%) |
| 갤럭시 A31 (4GB) | HyperCLOVAX-SEED-1.5B Q4_K_M 자체 약관 · 비교값 | 8 | 106.8 (84.6~129.7) | 8.8 | 3.8 | 12/25 (48%) | 14/25 (56%) | 12/30 (40%) | 28/30 (93%) |
| 노트북 i7-10750H | Qwen2.5-1.5B-Instruct Q4_K_M | 4 | 14.7 (12.7~21.3) | 77.4 | 18.8 | 13/25 (52%) | 13/25 (52%) | 12/30 (40%) | 30/30 (100%) |
HyperCLOVAX-SEED-1.5B 는 이 폰에서 한국어 품질이 가장 자연스러웠지만 라이선스가 자체 약관이라 비교값으로만 싣고 기본 모델로 쓰지 않습니다.
절차
폰에 올리는 법
# Termux(F-Droid) 에서
pkg install -y llama-cpp python git
git clone https://github.com/StopOrder/matjangbu && cd matjangbu
# 모델 파일을 ~/models/qwen1.5b.gguf 로
termux-wake-lock # 화면 꺼짐이 프로세스를 죽인다
bench/bench.sh --model qwen --threads 8,4 --device SM-A315N
# PC 에서 ssh 로 돌릴 땐 setsid nohup … < /dev/null & 로 세션에서 떼어낸다 — nohup 만으로는 ssh 가 끊길 때 같이 죽는다
A31 에서 확인된 설정: -t 8(빅코어 2개뿐인데도 8스레드가 가장 빨랐다), --jinja -fa on, repeat-penalty 1.05~1.08 이하(넘기면 한국어 조사·어미가 깨진다), --no-mmap 금지, KV 캐시 f16.
발열
장시간 구동 측정 예정
주일 한 번 몇 분 도는 용도라 10분 연속 구동 온도는 아직 재지 않았습니다. 상시 충전 서버로 쓰지 않는 이유이기도 합니다.