본문 바로가기

주메뉴 바로가기

전체메뉴

미디어룸

오늘을 넘어 미래의 가치를 만드는 더존ICT그룹의 소식을 만나보세요.

토큰 생성 없는 결정 모델, 밀리초로 잰 판단 속도

AI 트렌드2026.10.08
AI 트렌드

넘쳐나는 전 세계 AI 이슈, 핵심만 골라 ‘ONE AI’가 브리핑해 드립니다

01 / 06결정 모델 · 추론 지연
문장 대신 답을 바로 고르는 결정 모델, 응답을 밀리초 단위로 냈다
WHAT HAPPENED
•

LiquidAI가 텍스트를 생성하는 대신 질문에 대한 답을 바로 반환하는 결정 모델 d1-3B와 d1-omni-600M을 출시했습니다. 텍스트·JSON·이미지·음성 형태의 상태와 질문 목록을 입력받고, 생성 토큰 없이 모델의 분포에서 답을 직접 읽어내는 방식입니다①.

•

d1-3B는 Decision Index 0.2.1 기준 48.57점으로 10B 이하 모델 중 가장 높은 점수를 기록했고, 35B 규모 Decider 모델(47.11점)보다도 높았습니다. 추론 시간은 RTX 4090에서 8ms, Apple M5 Pro에서 30ms로 제시됐습니다②.

•

커뮤니티에서는 d1-omni-600M을 WebGPU 기반으로 브라우저에서 실행해, 댓글에 대한 4개 질문(독성, 스팸, 질문 여부, 어조)을 평균 180ms에 처리한 데모가 공유됐습니다③.

WHAT IT MEANS

결정 모델은 문장을 써 내려가는 대신 정해진 질문의 답을 바로 고르는 모델이며, 이번 공개에서도 성능은 글의 품질이 아니라 판단 과제 점수와 밀리초 단위 응답 시간으로 제시됐습니다.

8ms와 30ms는 RTX 4090과 Apple M5 Pro에서 제시된 추론 시간이고, 180ms는 브라우저에서 질문 4개를 처리한 커뮤니티 데모의 평균값이어서 같은 조건에서 나온 수치가 아닙니다. Decision Index 점수 역시 판단 과제를 기준으로 한 결과로, 대화나 글쓰기 능력을 비교한 값은 아닙니다.

이런 모델의 응답 시간을 볼 때는 어떤 질문 목록을 판단했는지, 어떤 하드웨어와 실행 환경에서 측정했는지를 수치와 한 묶음으로 비교할 수 있습니다.

02 / 06AI 수학 · 연구 감각
OpenAI 수학 결과, 정답 여부를 넘어 접근 방식이 평가 대상에 올랐다
WHAT HAPPENED
•

OpenAI가 공개한 수학 결과 중 바넷 추측(Barnette's Conjecture) 관련 풀이에서는 그래프의 변에 복소수 값을 갖는 지수 합을 적용하고 복소근과 소멸항을 활용하는 방식이 쓰였습니다. 이를 두고 한 수학 전문가는 그 기법이 어디서 나왔는지 이해하기 어렵다는 반응과 함께, 양자물리학에서 쓰이는 기호 조작 기법에 가깝다고 평가했습니다①.

•

Prinz의 트윗에서는 이번 결과가 단순한 문제 풀이 능력을 넘어, 수학자들이 말하는 '리서치 테이스트(research taste)', 즉 어떤 연구 방향이 유망한지 알아보는 감각을 보여준다는 분석이 나왔습니다②.

WHAT IT MEANS

이번 수학 결과에 대한 반응은 문제를 풀었는지보다 어떤 방식으로 접근했는지에 모였습니다.

한 평가는 수학자도 출처를 짐작하기 어려운 풀이 기법 자체에, 다른 평가는 유망한 방향을 고르는 감각에 주목했습니다. 두 평가는 모두 전문가 개인이 커뮤니티와 SNS에서 밝힌 해석으로, 결과에 대한 공식 검증과는 다른 층위입니다.

AI의 수학 성과를 이해할 때 결과가 맞았는지, 풀이 방식에 대한 전문가 해석이 어떤지, 공식 검증을 거쳤는지를 서로 다른 단계로 나눠 볼 수 있습니다.

03 / 06경량 모델 · 사용자 평가
Claude Haiku 5.5, 과제에 따라 사용자 평가가 엇갈렸다
WHAT HAPPENED
•

Anthropic이 경량·고속 모델 라인업 Claude Haiku의 최신 버전 5.5를 공개했습니다①. 실제 작업 흐름에 써본 사용자 게시글에서는 이전 버전보다 크게 나아졌다며 'major upgrade'로 평가했고, 응답 속도와 코딩, 일상 업무 보조에서의 향상이 언급됐습니다②.

•

다른 게시글에서는 'Lava Lamp Test'로 불리는 특정 창의적·시각적 추론 과제에서 Haiku 5.5가 기대에 미치지 못했다는 결과가 공유됐습니다③.

WHAT IT MEANS

같은 경량 모델이라도 어떤 과제로 써보느냐에 따라 사용자 평가가 크게 엇갈릴 수 있습니다.

호평은 응답 속도·코딩·일상 업무 보조처럼 실제 작업 흐름에서 나왔고, 아쉬운 평가는 하나의 창의적·시각적 추론 과제에서 나왔습니다. 두 평가 모두 공식 벤치마크가 아닌 사용자 경험에 기반한 것이어서, 모델 수준을 한 줄로 요약하기보다 과제 유형별 결과로 나눠 읽는 편이 사실에 가깝습니다.

04 / 06MoE · GPU 메모리
MoE 모델 구동, 전문가를 GPU에 전부 올리는 방식과 골라 올리는 방식
WHAT HAPPENED
•

한 사용자는 CMP 170HX 64GB 2장으로 GLM-5.3-Flash(총 320B 파라미터 중 18B가 활성화되는 MoE 구조)를 EXL3 3.05bpw로 양자화해 384K 컨텍스트에서 약 90 tok/s를 냈다고 공유했습니다. 약 125GB의 가중치를 두 GPU의 HBM 메모리에 모두 올려, 생성 중 시스템 RAM에서 전문가 가중치를 불러오지 않는 구성이었습니다①.

•

llama.cpp에는 호스트 메모리에 둔 MoE 전문가 가중치를 위해 GPU 캐시를 추가하는 PR이 올라왔습니다. VRAM이 부족해 일부 전문가를 CPU 메모리에 두는 환경에서, 자주 쓰이는 전문가를 GPU에 캐싱해 추론 속도를 높이는 방식입니다②.

WHAT IT MEANS

제한된 하드웨어에서 큰 MoE 모델(전체 파라미터 중 일부만 활성화해 쓰는 구조)을 돌리는 두 사례는 모두 '전문가 가중치를 어느 메모리에 두는가'를 중심에 두고 있습니다.

한쪽은 GPU 메모리를 충분히 확보해 가중치를 전부 올렸고, 다른 쪽은 GPU 메모리가 모자란 환경을 전제로 자주 쓰이는 전문가만 GPU에 두는 방식입니다. 90 tok/s는 특정 GPU 2장과 특정 양자화 설정에서 한 사용자가 공유한 수치이고, 캐시 PR에는 이번 자료에서 속도 수치가 제시되지 않아 두 방식의 효과를 직접 비교할 수는 없습니다.

05 / 06생성 가속 · MTP
생성 속도를 높이는 기법이 특정 모델에 맞춰 각각 적용됐다
WHAT HAPPENED
•

한 사용자는 Ternary Bonsai 2 27B 모델에 맞춰 DFlash2 드래프터를 다시 학습시켰고, L4 GPU에서 최대 2.2배, 코드 편집 작업에서는 3.15배의 추론 속도 향상을 공유했습니다①.

•

llama.cpp에는 GLM5Next 모델에 한 번에 여러 토큰을 예측하는 MTP(Multi-Token Prediction)를 추가하고 최적화하는 PR이 올라왔습니다②.

WHAT IT MEANS

이번 두 사례의 생성 속도 개선 작업은 모두 특정 모델 하나를 대상으로 이뤄졌습니다.

드래프터는 Ternary Bonsai 2 27B에 맞춰 다시 학습됐고, MTP는 GLM5Next 모델에 추가하는 형태입니다. 속도 수치는 드래프터 사례에서만 제시됐으며, 그마저 작업 유형별로 2.2배와 3.15배로 다르게 공유됐습니다①. 따라서 '몇 배 빨라졌다'는 수치는 어떤 모델과 GPU, 어떤 작업에서 나온 값인지와 떼어 읽기 어렵습니다.

06 / 06온디바이스 AI · 초소형 모델
81KB 모델과 4GB 폰, 작은 조건에서 결과물을 끝까지 완성했다
WHAT HAPPENED
•

4GB 램의 저가 스마트폰 Galaxy A04e에서 별도 수정 없는 GLM-Edge-1.5B-Chat 모델이 아마존 장바구니에 배터리와 고무오리를 담는 작업을 완수했습니다. 스크린샷이나 HTML 대신 구조화된 '브라우저 인지 레이어'만으로 판단했으며, 약 8.5분이 걸렸고 갤럭시 S21에서는 3분이 걸렸습니다①.

•

19,969개 파라미터, 용량 81KB인 MacroStories 모델이 100~300단어 분량의 완결된 이야기를 생성했습니다. 기존 TinyStories 모델보다 약 50배, AlexNet보다 약 3000배 작은 규모로 소개됐습니다②.

WHAT IT MEANS

이번 사례들은 모델 크기나 기기 사양이 아주 작은 조건에서도 중간 결과가 아니라 완결된 결과물까지 만들어낸 경우를 보여줍니다.

다만 조건은 서로 다릅니다. GLM-Edge 사례는 화면 이미지 대신 구조화된 정보를 입력으로 받았고 같은 작업의 완료 시간도 기기별로 8.5분과 3분으로 달랐으며①, MacroStories는 짧은 이야기 생성이라는 한정된 과제의 결과입니다. 두 사례 모두 개인이 공유한 실험이어서, 작은 조건에서 '가능했다'는 사례로 읽는 것이 정확하고 일반 업무 수준의 성능으로 넓혀 읽기는 어렵습니다.

기기 안에서 돌아가는 AI 사례를 볼 때는 입력이 화면 이미지인지 구조화된 정보인지, 기기 사양별 완료 시간이 어떤지, 과제 범위가 어디까지인지를 함께 비교할 수 있습니다.

본 콘텐츠는 공개된 사실 및 정보를 바탕으로, 당사의 편집 기준에 따라 생성형 인공지능(AI)에 의해 생성되었습니다. 최종 내용은 원문 대조 및 검수를 거쳐 발행하며, 참고한 각 자료의 저작권은 해당 저작권자에게 있습니다.

구매상담
1688
5000