아크릴, 구글·알리바바 LLM서 AI 추론효율 입증
추가 GPU·토큰 확대 없이 AI 정답률 최대 10.5%p 향상
아크릴은 대규모언어모델(LLM)의 추론 효율을 높이는 AI 추론 제어 기술을 다룬 논문이 자연어처리 분야 세계 최고 권위 국제 학술대회 중 하나인 ‘EMNLP 2026’ 메인 컨퍼런스(Main Conference)에 채택됐다고 29일 밝혔다.
이번에 채택된 기술은 추가적인 GPU 투입이나 토큰 예산 확대 없이 AI의 추론 정확도를 높이는 것이 핵심으로, 이미 아크릴의 AI 인프라 플랫폼 ‘GPUBASE’에 적용돼 상용화된 상태다.
최근 추론형 LLM과 AI 에이전트가 확산되면서 AI 경쟁력은 모델의 크기뿐 아니라 실제 서비스 단계에서 연산 자원과 토큰을 얼마나 효율적으로 활용하느냐에도 좌우되고 있다. 추론이 길어질수록 GPU 사용량과 서비스 비용, 응답 시간이 늘어나지만, 반대로 지나치게 줄이면 답변 정확도가 떨어질 수 있어 성능과 비용 간 균형이 주요 과제로 떠오르고 있다.
아크릴의 논문 ‘제한된 토큰 예산에서 AI의 추론 진행도를 양방향으로 조절하는 기술(ParentingLLM: Pacing Reasoning Maturity for Bidirectional Test-Time Scaling under Token Budgets)’은 문제의 난이도와 추론 진행 상태에 따라 AI의 사고 과정을 유연하게 조절하는 방법을 제안한다. 성급하게 결론에 도달하려 할 때는 추가 검토를 유도하고, 반대로 추론이 불필요하게 길어질 경우에는 사고 과정을 정리해 적절한 시점에 답변을 마무리하도록 하는 방식이다.
연구진이 구글 젬마(Gemma)와 알리바바 큐웬(Qwen) 계열의 소형부터 대형까지 총 4개 모델을 대상으로 수학·과학 분야 고난도 문제를 풀게 한 결과, 동일한 토큰 예산 조건에서 모든 모델의 정답률이 향상됐다.
특히 1024토큰 조건에서 4개 모델의 평균 정답률은 54.1%에서 58.7%로 4.6%p 높아졌으며, 소형 모델 ‘Gemma-4-E4B’는 39%에서 49.5%로 10.5%p 상승했다. 주어진 토큰을 모두 사용하고도 결론을 내지 못하는 ‘예산 초과’ 비율도 4개 모델 평균 20.7%에서 13.5%로 감소했고, Gemma-4-E4B는 26.1%에서 14.1%로 줄었다.
아크릴은 이를 통해 모델 규모를 키우거나 추가 GPU 자원을 투입하지 않고도 추론 제어만으로 AI 서비스의 성능과 자원 활용도를 높일 수 있음을 확인했다. 자체 파운데이션 모델 ‘아름(A-LLM)’에서도 추론 정확도 향상을 확인해 특정 모델에 종속되지 않는 적용 가능성도 확보했다.
해당 기술은 현재 GPUBASE의 LLM 추론 환경에 적용돼 판매되고 있다. 사용자는 별도의 토큰 예산 확대 없이 추론 과정을 효율적으로 제어해 AI의 응답 품질과 운영 효율을 높이는 데 활용할 수 있다.
아크릴은 향후 해당 기술을 생성형 AI에서 피지컬 AI까지 확대 적용할 계획이다. 회사는 650억원 규모 ‘협업지능 피지컬 AI 기반 소프트웨어(SW) 플랫폼 연구개발 생태계 조성’ 국가 연구개발 과제를 진행 중이다. 과제에서 아크릴은 피지컬 AI 플랫폼 ‘Jonathan PAI’를 기반으로 비전-언어-행동(VLA, Vision-Language-Action) 모델의 학습·추론·서빙과 이기종 로봇 실행 환경을 개발하고 있으며, 여기에 ParentingLLM의 추론 제어 기술을 연계할 예정이다.
아크릴은 피지컬 AI 환경에서도 작업 난이도와 상황에 따라 추론량을 동적으로 조절해 제한된 연산 자원 안에서 판단 정확도와 응답 속도를 함께 최적화하는 방향으로 기술을 고도화할 방침이다.
아크릴 관계자는 “AI 경쟁의 무게중심이 단순히 모델을 얼마나 크게 만드느냐에서 같은 자원으로 얼마나 높은 품질의 판단을 만들어내느냐로 이동하고 있다”며 “실제 제품 현장에서 먼저 검증한 추론 효율화 기술을 기반으로 기업의 AI 도입과 운영 비용 부담을 낮추고, 향후 생성형 AI에서 피지컬 AI까지 적용 범위를 확대해 나갈 것”이라고 말했다.