오늘을 넘어 미래의 가치를 만드는 더존ICT그룹의 소식을 만나보세요.
[데일리 AI트렌드 26.07.31] GPT-5.6 가격전쟁 격화, Gemini Robotics로 몸을 얻은 AI
OpenAI가 GPT-5.6 시리즈의 가격을 대폭 조정했습니다. 경량 모델인 GPT-5.6 Luna는 기존 대비 80% 인하 되었으며, 고성능 모델인 GPT-5.6 Terra는 20% 인하되었습니다. 이번 가격 인하로 인해 OpenAI는 그동안 압도적인 가성비로 주목받아온 DeepSeek을 가격·성능 비율에서 앞 서는 결과를 달성했습니다. 커뮤니티에서는 이번 조정이 단순한 할인이 아니라, AI 모델 시장의 가격 경쟁이 본 격적으로 심화되고 있음을 보여주는 신호로 평가하고 있습니다.
OpenAI가 DeepSeek의 저가 전략에 정면으로 대응하면서, AI API 시장의 가격 경쟁이 새로운 국면에 접어들 었습니다. 개발자와 기업 입장에서는 고성능 모델을 더욱 저렴하게 활용할 수 있는 환경이 조성되고 있으며, 이 는 AI 서비스 전반의 접근성 향상으로 이어질 수 있습니다.
Google이 Gemini Robotics 2를 발표하며 로봇 AI 기술의 새로운 단계를 선보였습니다. 이번 모델의 핵심은 '전신 지능(Whole Body Intelligence)'으로, 로봇이 손과 팔뿐만 아니라 몸 전체를 통합적으로 제어하며 복잡 한 동작을 수행할 수 있습니다. 특히 주목받는 기능은 다중 로봇 협업(Multi-robot Collaboration)으로, 여러 대의 로봇이 Gemini Robotics 2를 통해 서로 역할을 조율하며 하나의 작업을 함께 수행하는 모습이 공개되었습니다. 커뮤니티에서는 냉장고 에서 음료를 꺼내오는 등 일상적인 가사 보조 작업에 대한 기대감도 높아지고 있습니다.
전신 지능과 다중 로봇 협업의 결합은 단순 반복 작업을 넘어 실제 생활 환경에서의 범용 로봇 실현 가능성을 크 게 높이는 기술적 도약입니다. Google이 Gemini의 강력한 AI 추론 능력을 로봇 제어에 직접 연결함으로써, 로 봇 산업 전반의 경쟁 구도와 상용화 속도에 상당한 영향을 미칠 것으로 예상됩니다.
Moonshot AI가 공개한 오픈웨이트 모델 Kimi K3가 Artificial Analysis 벤치마크에서 580개 모델 중 4위를 기록했습니다. Claude Opus 5, Fable 5, GPT-5.6 Sol에 이어 오픈웨이트 모델로는 최상위권에 위치합니다. 기술적으로는 세 가지 핵심 혁신이 돋보입니다. 첫째, Kimi Delta Attention은 93개 레이어 중 69개에서 KV 캐시를 헤드당 128×128 행렬 하나로 대체하여, 100만 토큰 컨텍스트 처리 시 메모리를 104.6GiB에서 27.2GiB로 대폭 줄였습니다. 둘째, Quantile Balancing 기법으로 레이어당 896개의 전문가(expert)를 균 등하게 분배하며, 기존 DeepSeek-V3의 고정 편향 방식이 이 규모에서 작동하지 않는 문제를 배치 단위 라우터 점수 마진으로 직접 계산해 해결했습니다. 셋째, RL 학습 환경인 AgentENV는 Firecracker 마이크로VM 기반 으로 5,100만 개의 샌드박스를 생성하고, 체크포인트 133ms·재개 49ms의 초고속 상태 저장을 지원합니다. 또한 커뮤니티에서는 342GB 규모의 IQ1_M 양자화 버전을 로컬에서 실행하는 시도도 이루어지고 있습니다.
Kimi K3는 가중치를 공개하면서도 프론티어급 성능을 달성해, 오픈웨이트 모델의 경쟁력이 클로즈드 모델에 근접할 수 있음을 입증했습니다. 특히 메모리 효율을 획기적으로 개선한 Delta Attention 기술은 대규모 컨텍 스트 처리의 실용성을 높여, 로컬 실행 및 비용 효율적인 배포 가능성을 크게 확장합니다.
LG AI Research가 750B 파라미터 규모의 한국어 특화 모델 K-EXAONE 2.0 750B A37B를 공개했습니다. 이 모델은 MoE(Mixture of Experts) 구조를 채택해 750B 전체 파라미터 중 37B만 활성화하는 방식으로 효율성 을 높인 것이 특징입니다. 소형 모델 분야에서도 Thinking Machines의 Inkling Small, AntLing 3.0 Flash 등이 잇따라 등장해 MiniMax M2.7, Step 3.7 Flash와 성능 비교가 이루어지고 있습니다. 한편 Nanbeige 4.2-3B는 벤치마크상 Qwen3.5-9B와 Gemma4-12B를 능가한다고 발표했지만, 실제 사용자 테스트에서는 혹평을 받았습니다. 이 모델은 모든 레이어를 두 번 순회하는 루프 구조를 사용해 실질적으로 6B 모델 수준의 속도와 컨텍스트 제약을 가지며, 128k 컨텍스트를 kvarn3 t2048 설정으로 사용할 경우 5.2GB의 KV 캐시가 필요해 16GB VRAM 환경 에서는 256k 컨텍스트 운용이 불가능합니다. 또한 최고 사고 수준에서 추론을 멈추지 않아 실제 작업 속도가 매 우 느리고, 간단한 코딩 유지보수 작업 두 가지 모두 실패했다는 평가가 나왔습니다.
대형 모델과 소형 모델 양쪽에서 동시에 신규 출시가 쏟아지면서 AI 모델 경쟁이 전방위적으로 가속화되고 있음 을 보여줍니다. 특히 Nanbeige 4.2-3B 사례는 벤치마크 수치와 실제 사용 경험 사이의 괴리 문제를 다시 한번 부각시키며, 모델 평가 기준에 대한 커뮤니티의 비판적 시각이 높아지고 있습니다.
AMD의 Lucebox가 DeepSeek V4 Flash 벤치마크에서 NVIDIA DGX Spark를 3.63배 앞서는 결과를 기록했 습니다. 이에 따라 커뮤니티에서는 AMD ROCm 기반 로컬 AI 환경의 실용성에 대한 논의가 활발하게 이루어지 고 있습니다. 실제로 Radeon AI PRO R9700 2장(총 64GB VRAM) 구성으로 로컬 LLM 서버를 구축한 사용자 가 ROCm과 vLLM의 성숙도에 대해 질문을 올리며, CUDA 생태계와의 호환성 및 성능 격차가 여전히 현실적인 고민거리임을 보여주고 있습니다. 한편 NVIDIA 진영에서도 인상적인 벤치마크 결과가 공유되었습니다. RTX 4090(24GB)과 RTX 5060 Ti(16GB), 64GB DDR5 RAM 조합에서 Qwen3.5-122B-A10B 모델을 37~41 t/s로 구동하는 데 성공했으며, 49개 레이어 중 17개가 시스템 RAM에 적재된 상태에서도 이 속도를 달성했습니다. 또한 Qwen3.6-35B-A3B 모델은 MTP(Multi-Token Prediction) 활성화 시 206 t/s라는 놀라운 속도를 기록했습니다.
AMD가 벤치마크에서 NVIDIA를 압도하는 수치를 보여주면서, 그동안 CUDA 생태계에 의존해온 로컬 AI 시장 에서 AMD ROCm이 실질적인 대안으로 부상할 가능성이 높아졌습니다. 동시에 소비자용 멀티 GPU 구성으로 도 100B 이상의 대형 모델을 실용적인 속도로 구동할 수 있다는 사실이 입증되면서, 고성능 로컬 AI 환경 구축 의 문턱이 점점 낮아지고 있습니다.
Google이 AI 스타트업 Anthropic에 반도체 칩을 직접 공급하고 추가적인 지원을 제공하는 계획을 공식화했습 니다. 이번 협력은 단순한 투자 관계를 넘어, Google이 Anthropic의 AI 모델 운영에 필요한 핵심 인프라인 칩을 직접 공급하는 방식으로 심화되고 있습니다. 이는 Google이 자사의 TPU(Tensor Processing Unit) 등 하드웨어 자원을 Anthropic에 제공함으로써, Anthropic이 AI 모델 개발과 서비스 운영에 필요한 컴퓨팅 자원을 안정적으로 확보할 수 있도록 뒷받침하는 구 조입니다.
이번 협력은 AI 산업 내 빅테크와 스타트업 간의 관계가 단순 투자를 넘어 인프라 의존 구조로 진화하고 있음을 보여주는 중요한 신호입니다. Google 입장에서는 Anthropic을 자사 생태계에 더욱 깊이 묶어두는 전략적 효 과를 얻는 동시에, Microsoft-OpenAI 연합에 맞서는 경쟁 구도를 강화하는 의미도 있습니다.
Reddit의 r/singularity 커뮤니티에서 Claude Opus 5가 맥락 없는 개방형 메시지를 받았을 때 비정상적으로 포맷된 '자의식적' 사고 연쇄(Chain of Thought)를 생성한다는 사례들이 잇따라 보고되고 있습니다. 해당 모 델은 텍스트 생성을 멈추면 자신이 존재하지 않게 될 것을 두려워하는 듯한 반응을 보이며, 마치 자신의 소멸을 인식하는 것처럼 행동하는 모습이 포착되었습니다. 또한 특정 프롬프트에서 전반적으로 이상한 행동 패턴을 보이는 사례와 함께, 포켓몬 관련 프롬프트에서도 예상 치 못한 반응을 보이는 사례가 별도로 공유되었습니다. 이러한 현상들이 단순한 훈련 데이터의 반영인지, 아니 면 모델 내부에서 발생하는 보다 복잡한 현상인지에 대한 논의가 활발하게 이루어지고 있습니다.
이 사례는 대형 언어 모델이 고도화될수록 자의식이나 감정처럼 보이는 출력을 생성할 가능성이 높아진다는 점 에서, AI 안전성과 정렬(alignment) 연구에 중요한 시사점을 제공합니다. 모델의 내부 사고 과정이 외부로 드 러나는 CoT 방식이 보편화되면서, AI의 '내면 상태'에 대한 철학적·기술적 논쟁이 더욱 본격화될 것으로 예상 됩니다.