오늘을 넘어 미래의 가치를 만드는 더존ICT그룹의 소식을 만나보세요.
[Vol.31] 완벽에 가까운 AI 성능, 그러나 커지는 비용의 무게

이번 주 AI 업계의 변화는 '현장'에서 뚜렷하게 감지됩니다. 기업은 AI를 얼마나 썼는지가 아니라 얼마나 검증했는지를 평가 기준으로 삼기 시작했고, 'AI가 초안, 사람이 검증'하는 역할 분담 구조가 반복 업무 자동화의 실질적 성공 공식으로 자리 잡고 있습니다. 동시에 AI 성능은 특정 업무에서 인간을 압도하는 수준에 이르렀지만, 그 성능을 둘러싼 비용 관리라는 새로운 과제도 함께 떠오르고 있습니다.
삼성전자·LG디스플레이·HD현대는 승진과 채용 기준에 AI 활용 역량을 공식적으로 포함시켰고, 케이잡스의 AI 역량진단은 AI 결과물을 검증하는 행동까지 평가 항목으로 삼았습니다. '얼마나 썼는가'에서 '어떻게 검증했는가'로 평가의 축이 옮겨가고 있습니다.
웹케시와 KS C&C는 'AI가 초안을 만들고 사람이 검증한다'는 같은 원칙으로 각각 금융 관리업무와 심사·대금 관리를 자동화했고, 웹케시는 이 경험을 금융권 고객사 사업으로까지 확장하고 있습니다.
회계 업무 벤치마크에서 AI는 사실상 완벽에 가까운 정확도를 기록하며 인간 회계사를 크게 앞질렀습니다. 그러나 같은 시기 마이크로소프트는 비용 절감을 위해, 메타는 자체 도구 확산과 구조조정을 거치며 각각 사내 AI 사용 규모를 줄였습니다. 성능의 급성장과 비용·효율 관리라는 과제가 동시에 진행되고 있는 모습입니다.
ㆍ 삼성전자·LG디스플레이·HD현대는 승진·채용 기준에 AI 역량을 공식 반영했고, 케이잡스의 AI 역량진단은 AI 결과물 검증 행동까지 평가합니다.
ㆍ 웹케시와 KS C&C는 'AI가 초안, 사람이 검증'하는 구조로 반복 업무를 자동화했고, 웹케시는 이 경험을 금융권 고객사 사업으로 확장하고 있습니다.
ㆍ 회계 업무에서 AI는 인간을 압도하는 정확도를 보였지만, MS·메타는 비용 부담으로 사내 AI 사용에 한도를 두며 성능과 비용 사이에서 균형을 찾고 있습니다.
삼성전자는 올해 임원 목표관리(MBO) 평가에서 'AX 역량 제고' 배점을 기존 2~5점에서 20점으로 대폭 높였습니다. 조직 효율성 제고 10점, 업무 워크플로 재정립 5점, AI 에이전트 확보 5점으로 구성되며, AI 도입으로 업무시간과 개발·검증 기간을 얼마나 줄였는지도 수치로 평가합니다. 사장단과 관계사 임원 2300여 명에게는 프롬프트 작성과 AI 에이전트 개발을 포함한 실습 교육이 진행됐습니다. LG디스플레이는 책임 직급(과·차·부장급) 승진 조건에 'AX 교육 레벨1' 이상 수료를 의무화했고, 전체 임직원의 약 94%가 이미 레벨1 이상을 취득했습니다. HD현대는 하반기 신입 공채에 'AI 활용 역량검사'를 처음 도입해, 생성형 AI로 과제를 해결하는 능력과 AI 결과물을 비판적으로 판단·재구성하는 능력을 함께 평가합니다.
이런 변화는 실제 몸값으로도 연결됩니다. PwC가 6개 대륙의 채용공고 10억 건 이상을 분석한 결과, AI 관련 역량을 요구하는 일자리의 평균 임금 프리미엄은 62%로 지난해 57%보다 높아졌습니다. AI 기술을 요구하는 채용공고 증가율도 69%로, 전체 일자리 증가율 9%의 약 8배에 달했습니다. 국내도 비슷한 흐름입니다. 채용 플랫폼 원티드랩이 국내 기업 인사 담당자 130명을 조사한 결과 77.2%가 AI 역량을 갖춘 지원자에게 추가 연봉을 지급할 의향이 있다고 답했고, 추가 지급 의향은 연봉의 1~10%가 45.6%, 11~20%가 28.1%였습니다.
평가의 초점은 '사용 여부'에서 '검증 행동'으로도 번지고 있습니다. 케이잡스가 10월 6일 공개한 'AI 역량진단'은 자기평가와 확률 판단·일정 짜기 등 판단 과제, 직무별 AI 상대역과의 대화, 경험 질문을 종합해 문제해결·계획실행·학습민첩·소통협업·회복탄력·책임성실 등 6개 역량을 분석합니다. 특히 시범 운영 중인 심층 진단 '회사 체험'에서는 응시자가 가상 회사의 신입사원이 되어 AI 비서가 작성한 보고서 초안의 숫자를 원자료와 대조하는 과정이 포함돼, AI 결과를 그대로 쓰는지 검증하며 쓰는지를 평가 항목으로 삼았습니다.
기업과 채용시장 모두에서 평가의 기준이 'AI를 썼는가'에서 '그 결과를 어떻게 검증했는가'로 이동하고 있습니다.
AI로 단축한 업무 시간과 바뀐 업무 흐름을 수치로 기록해 두고, AI 결과물을 원자료와 대조하는 검증 습관을 평소 업무에서부터 갖춰야 합니다.
웹케시그룹은 우수 개발자를 우대하던 제도를 폐지하고, 직군과 관계없이 AI로 생산성을 높인 직원을 선발하는 'AX 마스터' 제도를 도입해 올해 20명을 선정했습니다. '궁금한 점이 생기면 자료나 사람을 찾기 전에 AI부터 활용한다'는 'ASK AX FIRST' 원칙 아래 관리지원 업무를 집중적으로 자동화한 결과, 지출결의·ERP 데이터 검증은 월 10시간 이상에서 2시간 이내로, 정산 잔액 검증은 10시간에서 20분 수준으로 줄었습니다. 법인카드 감사는 4명이 월 40시간을 쓰던 업무가 1명이 4시간에 처리하는 수준으로, 계열사 계약서 검토는 400시간에서 167시간으로 약 60% 단축됐습니다. 작년까지 40여 명이 지속적으로 야근하던 관리지원 부문은 올해 8월 기준 인력이 25명으로 줄었고, 야근 문화 자체가 사라졌습니다.
웹케시는 이렇게 사내에서 검증한 경험을 고객사 사업으로 확장하고 있습니다. 자금관리 서비스 '브랜치'와 연구비관리시스템 'rERP'에는 이미 AI 에이전트가 적용됐고, 지난 6월 수주한 NH농협은행의 기업 에이전트뱅킹 사업에서는 잔액·거래내역 조회 기능을 먼저 구축한 뒤 이체와 신청 처리까지 확대하는 방안을 협의 중입니다. 2027년까지 기업 인터넷뱅킹을 에이전트 기반으로 전환하는 것을 목표로, 다른 은행 3곳과도 관련 사업을 논의하고 있다고 밝혔습니다.
AI 업무 자동화 기업 KS C&C도 'AI가 초안을 만들고 사람이 검증한다'는 같은 원칙으로 업무 영역을 넓히고 있습니다. 사내 챗봇은 회사 내규와 노동법 정보를 검색해 휴가·근무제도 문의에 답하고, 렌털 심사 업무에는 광학문자인식(OCR)과 기존 심사보고서로 학습한 GPT-4o 기반 에이전트가 서류 데이터를 추출해 보고서 초안을 작성하되, 담당자가 원본 문서와 비교·검증하도록 프로세스를 설계했습니다. 고객 문의 처리는 웹사이트 접수부터 유형 판단, 담당자 지정, 메일 전달까지 전 과정을 자동화했고, 매출·매입 대금 관리에서는 지급 대상을 자동 정렬해 담당자의 비교 검토 업무를 줄였습니다.
'AI가 초안을 만들고 사람이 검증한다'는 역할 분담 구조가 반복 업무 자동화의 실질적 성공 공식으로 자리 잡고 있으며, 웹케시는 이 경험을 금융권 고객사 사업으로까지 확장하고 있습니다.
반복 업무에서 'AI가 초안, 사람이 검증'하는 역할 분담 구조를 먼저 사내에서 증명한 뒤, 고객 제품으로 확장하는 순서를 참고할 만합니다.
데이터 분석 전문기업 머코어의 평가에서, 앤트로픽의 '클로드 오퍼스 5'는 실제와 유사한 월말 결산 업무 벤치마크에서 100%에 가까운 정확도를 기록했습니다. 반면 평균 5년 반의 경력을 가진 공인회계사 12명은 평균 37%에 그쳤습니다. 회계사들은 과제 하나를 완료하는 데 30분에서 최대 180분이 걸렸지만 AI는 10분 이내에 마쳤고, 평가 기준 충족 비용도 AI는 0.21달러로 회계사의 미국 평균 임금 기준 10.35달러보다 약 50배 저렴했습니다. 성장 속도도 가팔랐습니다. 2024년 5월 'GPT-4o'는 이 과제에서 0%에 가까운 점수를 받았지만 2025년 5월 'o3'가 회계사 평균을 넘어섰고, 최근 등장한 모델들은 완벽에 가까운 수행 능력에 도달했습니다. 불과 18개월 전만 해도 최상위 모델조차 회계사 평균 점수(37%)를 밑돌았다는 점을 고려하면 가파른 성장세입니다.
다만 연구진은 이 결과가 회계사가 AI로 대체돼야 한다는 의미는 아니라고 분명히 선을 그었습니다. 실험이 동료의 도움이나 기업 내 축적된 맥락 정보가 완전히 차단된 격리 환경에서, 하나의 수치만 놓쳐도 감점이 누적되는 정교한 구조로 설계돼 인간 회계사에게 불리했다는 점을 밝혔습니다. 고객과의 소통이나 암묵적 맥락 파악 같은 비구조화된 업무도 측정 대상에서 제외됐습니다. 연구진은 "기존 벤치마크가 인간이 하는 일을 AI가 얼마나 잘 따라 하는가를 측정했다면, 이제는 비용이나 시간 문제로 인간이 할 수 없었던 복잡한 작업을 측정하는 방향으로 평가 기준이 이동하고 있다"고 짚었습니다.
성능이 가파르게 좋아지는 동안, 비용을 둘러싼 긴장도 함께 커지고 있습니다. 마이크로소프트는 올해 초 직원들의 앤트로픽 AI 사용에 연간 10억 달러 이상을 지출할 것으로 예상했지만, 클로드 코드 구독을 줄이고 자체 깃허브 코파일럿 사용을 유도해 관련 지출을 3분의 1 이상 낮췄고 MS 클라우드 및 AI 부문에서는 직원 1인당 AI 사용 한도도 월 10만 달러에서 대부분 1만 달러로 낮췄습니다. 다만 MS가 앤트로픽에 지불하는 전체 비용은 같은 폭으로 줄지 않았는데, 코파일럿 등 고객용 기능에 클로드를 제공하는 비용이 오히려 늘어 직원용 사용 감소분을 상쇄했기 때문입니다. 메타에서도 내부 클로드 코드 사용자가 올해 초 6만 명에서 최근 3만 명으로 줄었습니다. 봄철 구조조정에 따른 인원 감소도 일부 영향을 줬지만, 더 큰 요인은 자체 개발한 경쟁 도구 '뮤즈 코드'와 '메타코드'로 사용자가 옮겨간 것입니다. 한편 올해 초에는 직원들이 AI 사용량을 늘려 성과를 과시하는 '토큰맥싱' 현상도 나타나, 경영진이 지난 6월 AI 사용 예산과 토큰 한도를 별도로 도입했습니다.
AI 성능이 특정 업무에서 인간을 압도하는 수준에 이르렀지만, 그 성능을 '얼마나, 어떻게' 쓸 것인가에 대한 비용 관리가 기업의 새로운 과제로 떠오르고 있습니다.
AI 성능 수치만 보고 전면 대체를 가정하지 말고, 업무 성격에 맞는 모델과 사용량을 선택하는 비용 감각을 함께 갖춰야 합니다.
본 콘텐츠는 공개된 사실 및 정보를 바탕으로, 당사의 편집 기준에 따라 생성형 인공지능(AI)에 의해 생성되었습니다. 최종 내용은 원문 대조 및 검수를 거쳐 발행하며, 참고한 각 자료의 저작권은 해당 저작권자에게 있습니다.
이전글이 없습니다
토큰 생성 없는 결정 모델, 밀리초로 잰 판단 속도
2026.10.08