엔비디아 GPU서 헤르메스·오픈클로·퍼플렉시티 에이전트 지원… 로컬 AI 간소화
퍼스널 AI 라우터 도구 ‘엔비디아 페어’... 사용자 로컬 네트워크 PC 전반에 AI 추론 분산
엔비디아가 독일 베를린에서 열리는 ‘IFA 2026’에서 로컬 AI의 접근성과 성능을 높이는 신기술을 발표하고, 다양한 파트너사와 로컬 AI 생태계 확장에 나선다고 밝혔다. 아울러 오는 10월 엔비디아 RTX 스파크(NVIDIA RTX Spark) 윈도우 PC 출시 계획과 주요 게임사들의 지원 소식도 공개했다.
프론티어 인텔리전스가 로컬 환경으로 확장되는 가운데, 엔비디아는 마이크로소프트(Microsoft)를 비롯한 파트너사와 협력에 나서고 있다. 엔비디아 하드웨어에서 에이전트를 보다 쉽게 설정하고 로컬에서 실행할 수 있도록 빠른 추론 성능과 새로운 도구를 제공하기 위해서다.
한편 새로운 소형 윈도우(Windows) PC인 엔비디아 RTX 스파크가 오는 10월 출시될 예정이다. RTX 스파크를 통해 AI 애호가와 개발자, 크리에이터는 강력한 에이전트를 로컬 환경에서 안전하게 실행할 수 있다.

로컬 모델로 로컬 에이전트를 실행하려면 일정 수준의 작업이 필요했다. 모델을 선택하고, 호환되는 추론 서버를 찾으며, 양자화 설정을 조정하고, 모든 구성 요소를 최신 상태로 유지해야 했다. 이러한 과정은 RTX와 DGX 시스템에서 한층 간소화되고 있다.
가장 널리 사용되는 에이전트 앱 3종이 윈도우에서 간소화된 로컬 모델 설정을 제공할 예정이다. 각 앱은 라마.cpp를 기반으로 구축됐으며, 엔비디아의 최신 추론 최적화를 활용한다. 새로운 설정 환경은 수동 구성을 줄이고 로컬 에이전트를 보다 쉽게 설정하고 실행할 수 있도록 설계됐다.
지난달 퍼플렉시티는 포터블 컴퓨터 에이전트를 공개했다. 사용자는 모델, 오케스트레이션, 도구가 하나의 앱 환경에 통합된 퍼플렉시티를 엔비디아 DGX 스파크와 같은 리눅스(Linux) 시스템에서 로컬로 간편하게 실행할 수 있다.
퍼플렉시티 포터블 컴퓨터는 리눅스를 실행하는 최소 24GB VRAM 엔비디아 RTX GPU에서 이용할 수 있으며, 윈도우 지원은 추후 제공될 예정이다. 폭넓은 PC 사용자에게 간소화된 설정 환경을 제공하는 한편, 사용자는 크레딧을 사용하지 않고 전체 워크플로우를 로컬에서 실행할 수 있다. 추가적인 조사나 추론이 필요한 경우에는 작업의 일부를 클라우드의 15개 이상 프론티어 모델을 선택해 확장할 수 있다. 포터블 컴퓨터는 콘텐츠를 클라우드로 전송하기 전에 사용자 권한을 요청하며, 사용자가 민감한 정보를 기기에 보관할 수 있도록 한다.
포터블 컴퓨터는 지금 이용
누스 리서치(Nous Research)가 개발한 헤르메스 에이전트는 수백만 명이 사용하는 범용 에이전트로, 높은 신뢰성과 자기 개선 능력이 강점이다. 모델과 제공업체에 구애받지 않는 헤르메스는 로컬 시스템에서 하루 종일 실행될 수 있으며, RTX PC, RTX PRO 워크스테이션, DGX 스파크와 자연스럽게 어울린다.
헤르메스에서 로컬 모델을 구성하면 윈도우 환경의 RTX, DGX 시스템에서 원클릭 설정이 제공될 예정이다. 에이전트는 엔비디아 GPU를 자동으로 감지하고 적절한 모델과 구성을 선택한 뒤, 엔비디아 추론 최적화가 적용된 통합 라마.cpp를 통해 실행한다. 따라서 사용자는 모델을 직접 다운로드하거나 별도로 튜닝할 필요가 없어진다. 리눅스 지원은 추후 제공될 예정이다.
실행이 시작되면 헤르메스는 다른 환경과 동일한 방식으로 작동한다. 다양한 도구를 활용하고 작업 간 맥락을 유지하며, 세션 정보를 기억하고 시간이 지남에 따라 재사용 가능한 스킬을 생성한다. 에이전트를 지속적으로 사용할수록 에이전트의 기능과 활용 범위가 더욱 확장된다. 모델을 GPU에서 로컬로 실행하면 빠른 성능을 유지하면서도 데이터를 시스템 내부에 보관할 수 있다.
원클릭 로컬 모델 설정 기능은 현재 윈도우에서 사용 가능하며, 향후 리눅스에서도 제공될 예정이다. 여기에서 헤르메스 에이전트에 대해 자세히 알아볼 수 있다. 오픈클로는 대표적인 오픈 에이전트 프로젝트로 자리 잡았다. 깃허브에서 38만 개 이상의 스타를 받은 최대 규모의 AI 프로젝트이며, 연구와 엔지니어링, 프로젝트 관리, 일상 업무 등 다양한 분야에서 도구와 스킬을 구축하는 커뮤니티도 빠르게 성장하고 있다.
엔비디아와 마이크로소프트, 오픈클로는 윈도우 PC에서 구축을 간소화하도록 협력해 왔다. 오픈클로 윈도우 앱은 최소 24GB VRAM을 갖춘 모든 RTX GPU에서 최적화된 로컬 모델 구축 과정을 간소화하며, 초기 설정의 불편을 줄인다.
로컬 AI 컴퓨팅에 유휴 PC 자원 활용
미국 가정의 절반 이상은 PC를 두 대 이상 보유하고 있다. 그러나 상당한 컴퓨팅 성능이 하루 중 대부분 사용되지 않는 상태로 남아 있다. 엔비디아 퍼스널 AI 라우터 ‘페어’는 유휴 PC 컴퓨팅 자원을 로컬 AI에 활용할 수 있도록 지원하는 무료 오픈소스 소프트웨어 도구다.
많은 경우 에이전틱 워크플로우는 복잡한 작업을 병렬로 실행 가능한 작은 작업으로 분할한다. 그러나 모든 요청이 동일한 GPU를 활용한다면 성능이 저하될 수 있다. 페어는 로컬 네트워크에서 호환되는 PC를 자동으로 검색하고, 여유 용량이 있는 시스템으로 개별적인 추론 요청을 전달한다. 이는 올라마와 LM 스튜디오에서 활용 가능하며, 기기가 네트워크에 연결되거나 연결 해제되는 상황에도 대응할 수 있다.
예를 들어 사용자는 헤르메스에 복잡한 메일함을 정리하고 주의가 필요한 항목과 미룰 수 있는 항목, 건너뛸 수 있는 항목의 우선순위를 정하도록 요청할 수 있다. 헤르메스는 이러한 작업을 여러 하위 에이전트로 나눌 수 있으며, 페어는 모든 작업을 하나의 GPU를 거치게 하는 대신 사용 가능한 여러 PC에 작업을 분산한다.
그 결과 로컬 에이전트는 더 많은 컴퓨팅 성능을 활용할 수 있으며, 더 많은 작업을 병렬로 실행할 수 있다. 또한 메인 시스템이 게이밍이나 콘텐츠 제작, 기타 작업에 사용되는 동안 AI 워크로드를 다른 PC로 옮길 수도 있다.
엔비디아 페어 베타는 그래픽, 터미널 인터페이스를 통해 윈도우, 맥OS(macOS), 리눅스에서 이용할 수 있다. 엔비디아 지포스 RTX 20 시리즈 GPU와 이후 제품군, 튜링(Turing) 또는 이후 아키텍처를 탑재한 엔비디아 RTX PRO 워크스테이션 GPU, 엔비디아 DGX 스파크, 애플(Apple) M4와 이후 제품이 지원된다.
<저작권자(c)스마트앤컴퍼니. 무단전재-재배포금지>















