엔비디아, 램 수요 1/8로 줄이는 획기적인 기술 개발

작성자 정보

  • 42 부드러운공기 작성
  • 작성일

컨텐츠 정보

본문

https://www.all-ai.de/news/news26/nvidia-speicher-8x

 

 

엔비디아는 텍스트 생성 시 언어 모델의 메모리 요구량을 크게 줄이는 새로운 방법인 동적 메모리 희소화(DMS)를 도입했습니다.

이 기술은 소위 KV 캐시를 8분의 1로 압축하면서도 계산 정확도는 눈에 띄게 저하되지 않습니다.

 

 

RAM의 병목 현상


최신 AI 모델은 복잡한 질의에 대해 최종 답변을 내놓기 전에 상세한 추론 과정을 거칩니다. 생성된 각 중간 단계는 소위 키-값 캐시(KV 캐시)에 공간을 차지합니다. 이 캐시는 기존 컨텍스트를 저장하여 프로세서가 새로운 단어가 입력될 때마다 컨텍스트를 완전히 다시 계산할 필요가 없도록 합니다. 추론 과정이 길어지면 그래픽 카드의 비디오 메모리가 매우 빠르게 가득 차게 됩니다.

이는 필연적으로 하드웨어 한계로 이어지는데, 그래픽 메모리 용량이 응답 시간의 최대 길이를 제한하기 때문입니다. 더 긴 응답 시간을 구현하기 위해 운영자들은 이전에는 더 많은 RAM을 갖춘 고가의 컴퓨팅 클러스터를 결합해야 했습니다. 그러나 단순히 하드웨어 크기를 늘리는 것은 확장성이 떨어지고 운영 비용만 증가시킵니다.

 

 

동적 데이터 정렬


엔비디아의 솔루션은 바로 이러한 메모리 문제를 해결합니다. DMS 방식은 텍스트 출력 중에 캐시에 저장된 토큰의 중요도를 지속적으로 분석합니다. 이 알고리즘은 중요하지 않거나 중복되는 정보를 메모리에서 즉시 삭제합니다. 논리적 맥락에 절대적으로 필요한 데이터만 추가 계산에 남게 됩니다.

기존 압축 방식과 달리 이 기술은 고정된 매개변수에 따라 작동하지 않습니다. 발표된 연구 논문에 따르면 삭제 과정은 특정 작업에 맞춰 실시간으로 조정됩니다. 에든버러 대학교 연구진은 분석을 통해 이러한 목표 지향적인 저장 공간 축소가 출력 품질을 안정화시킨다는 사실을 밝혀냈습니다. 즉, 매우 긴 텍스트에서 불필요한 문맥 정보로 인해 모델이 초점을 잃을 가능성이 줄어든다는 것입니다.

 

 

실제 효율성 향상

 

DMS를 통해 달성된 메모리 절감 효과 덕분에 기존에 필요했던 시스템 리소스의 극히 일부만으로도 모델을 운영할 수 있습니다. 엔비디아는 문서에서 메모리 압축률을 8배까지 낮출 수 있다고 명시하고 있습니다. 이는 서버가 동일한 그래픽 카드에서 8배 더 큰 컨텍스트 창을 처리할 수 있다는 것을 의미합니다. 하지만 실제로 이 이론적인 수치가 모든 모델 유형에서 유효한지는 추가적인 검증이 필요합니다.

초기 구현 버전은 이미 개발자 커뮤니티에서 이용 가능합니다. DMS 기술을 기본적으로 실행하는 기존 언어 모델의 수정된 버전은 머신 러닝 플랫폼에서 찾아볼 수 있습니다. 동시에 제조사는 해당 코드를 기존 기본 라이브러리에 통합하고 있으며, 현재 초기 실용 테스트가 진행 중입니다.

 

 

램쫀쿠 멸망의 시작인가?

도움 자료: 온라인카지노 순위

관련자료

댓글 22

망고와망고님의 댓글

  • 14 망고와망고
  • 작성일
애초에 포스터발표 따리 잡연구임

지민정님의 댓글

  • 12 지민정
  • 작성일
도로가 좋아지면 사람들은 차를 더 많이 사지 ㅋㅋ

부드러운공기님의 댓글

  • 42 부드러운공기
  • 작성일
근데 그 차에 넣을 기름이 없는 상황임 ㅋㅋ

대방님의 댓글

  • 17 대방
  • 작성일
겠냐부족한 램 우리가 최첨단 기술로 더 보강해서 앞서간다 하지우리램 그만살거임 선언해서 가격 떨어진다 예상은 개하수 ㅋㅋ

자작앰프만드는사람님의 댓글

  • 12 자작앰프만드는사람
  • 작성일
캐시에 들어가는간 낸드라고 들었음.Hbm하고 Lpddram는 그대로 인듯?샌디스크 주가 떨어질려나

부드러운공기님의 댓글

  • 42 부드러운공기
  • 작성일
kv캐시가 hbm임

wookoko님의 댓글

  • 77 wookoko
  • 작성일
이젠 진짜 끝나가나봐..

x0은0님의 댓글

  • 14 x0은0
  • 작성일
3월 로빈나오는데?

또속냐님의 댓글

  • 38 또속냐
  • 작성일
빅테크 호재인가

부드러운공기님의 댓글

  • 42 부드러운공기
  • 작성일
램을 절반만 넣었다고 엔비가 싸게 팔까? ㅋㅋ

미친듯한존재감님의 댓글

  • 20 미친듯한존재감
  • 작성일
context size를 8배 늘리겠지 맨날 그거 늘리는데 혈안인데

무다쿠치렌야님의 댓글

  • 29 무다쿠치렌야
  • 작성일
줄인만큼 더 늘리면 더 좋다

ira님의 댓글

  • 24 ira
  • 작성일
삼전 떨어지려나

꺾인마음님의 댓글

  • 11 꺾인마음
  • 작성일
하드웨어 발전속도의 물리적 한계는 ai의 발전속도에 병목현상으로 작용하기 때문에 앞으로는 더더욱 최적화에 집중할 수 밖에 없을듯

레알찐님의 댓글

  • 33 레알찐
  • 작성일
NVIDIA Vera Rubin NVL72 같은 모델에 램이 20.7TB 들어가거든? 그거 좀 차기작은 줄여서 한 15테라 넣겠다 그런거 아닐까?

고잡추채님의 댓글

  • 18 고잡추채
  • 작성일
저런거보단 전력 효율을 좀 어케 해봐라, 무슨 그래픽 카드 하나가 전자렌지보다 더 전기를 처먹냐? ㅋㅋㅋ 미세 공정으로 가면 성능은 더 올리지 말고 전력소모만 어케 줄여봐

x0은0님의 댓글

  • 14 x0은0
  • 작성일
로빈에 들어가니마니하는

US991231님의 댓글

  • 42 US991231
  • 작성일
짜잔컨텍스트 창을 8배 늘린 램이 나왔대오

피냐타님의 댓글

  • 47 피냐타
  • 작성일
모든지 적당해야됨... 나중에 후폭풍 쎄게옴, 램값 너무 비싸서 중국 램조차 사용하려고 하잖아

부드러운공기님의 댓글

  • 42 부드러운공기
  • 작성일
안그래도  SOCAMM이니 HBF 하니 그런게 전부 HBM 너무비싸서 개발되고 있는 기술들이니물론 역할이 100% 똑같지는 않지만

핵대가리님의 댓글

  • 11 핵대가리
  • 작성일
엥 gpu한대당 들어가는 램의 효율이 늘어났단소리고 이럼 실제로 램 수요가 줄어들수도 있겠지만Gpu를 더 쓰면 상충되는거 아니야? 기업이 싸지면 더 안쓸리가 없는데

부드러운공기님의 댓글

  • 42 부드러운공기
  • 작성일
TSMC 캐파는 언제 늘어나고 GPU 굴릴 전기는 어디서 구해오는데?하나만 알고 둘은 모르는구만