라이프 브리핑
1985~2026.07.26·1화량원펑 : 차이나 올트만
중국의 샘 올트만
1985~2025.03·5화수학 천재의 연쇄 창업 실패
환상적인 반딧불 인공지능으로 하이 플라이
우여곡절 딥시크 창업
저비용 고효율 딥시크 인공지능의 해자
글로벌 딥시크 쇼크
량원펑 : 중국의 샘 올트만
2015~2024.12.26·1화량원펑 : 중국의 샘 올트만
량원펑 : 딥시크 사이버 테러
2020.03~2025.01.28·1화량원펑 : 딥시크 사이버 테러
중국 테크 미디어 36Kr와의 인터뷰
1980~2024.07.22·1화“오픈AI는 신이 아니다”
2025년 01월 29일 수요일
저비용 고효율 딥시크 인공지능의 해자
량원펑은 오픈AI도 못한 멀티 헤드 잠재 어텐션 모델을 개발하고 엔비디아보다 엔비디아 GPU를 더 최적화해버리는 딥시크의 혁신 문화를 만들었습니다.

1
량원평은 2023년 11월 2일 첫 오픈소스 AI 모델 딥시크 코더를 공개했다.
2
량원펑은 딥시크 코더를 출시하면서 프랑스 영화 감독 프랑소와 트뤼포의 “미친 야망을 가져라”를 인용했다.
3
량원펑은 딥시크 코더부터 오픈 소스 전략을 선택했다.
4
량원펑은 딥시크 코더의 코드와 가중치를 깃허브와 허깅페이스에 공개했다.
5
2017년 베이징 대학교 물리학과를 졸업한 가오화쭤와_2021년 베이징 우전대를 AI 연구소에서 석사 과정을 마친 쩡완딩은=미국 모델의 어텐션 모델을 업그레이드할 수 있는 방법을 찾아냈다.
6
량원펑은 가오화쭤와 쩡완딩에게 인력과 비용을 지원했고+수개월의 연구 끝에 멀티 헤드 잠재 어텐션 모델이 만들어졌다.
7
량원평은 2024년 5월 딥시크-V2를 공개했다.
8
랑원펑은 가오화쭤와 쩡완딩과 함께=딥시크-V2 모델부터 멀티 헤드 잠재 어텐션=Multi-Head Latent Attention을 적용했다.
9
멀티 헤드 잠재 어텐션은 기존의 어텐션 아키텍처가 하나의 주제 차원에서 데이터를 처리하는 것과 달리+데이터의 중요 세부 사항을 반복 추출하고 다중 주제를 활용해서 문맥과 감정과 논리를 분석하는 방식이다.
10
멀티 헤드 잠재 어텐션은 법률 문서나 의학 문서의 요약에서 기존 모델 대비 20% 높은 정확도를 보여줬다.
11
멀티 헤드 어텐션 모델은 메모리 소비를 최대 93%나 줄였다.
12
멀티 헤드 어텐션 모델은 추론 효율은 2배 이상 향상됐다.
13
딥시크-V2에서 멀티 헤드 어텐션 모델을 성공시키면서+량원펑은 딥시크의 진정한 해자는 창의적이고 개방적이고 혁신적인 조직 문화라고 확신했다.
14
2024년 6월 2일 젠슨 황 엔비디아 CEO는 대만 타이베이에서 열린 컴퓨텍스 2024 기조연설에서=“멀티 헤드 잠재 어텐션 모델이야 말로 트랜스포머 최적화의 새로운 표준”이라고 말했다.
15
딥시크-V2의 기술 보고 논문은 2024년 올해 최고의 논문 평가됐다.
16
딥시크-V2는 저렴한 추론 비용으로 중국 내에서 주목 받기 시작했다.
17
딥시크-V2로 인해 중국 내수 시장 안에선 텐센트+바이트댄스+바이두+알리바바의 AI 가격 경쟁이 촉발했고=중국 AI 시장의 메기로 불리기 시작했다.
18
딥시크-V2가 주목 받으면서+딥시크는 중국에서 AI의 판둬둬라고 불리기 시작했다.
19
2024년 7월 량원펑은 중국 테크 미디어 36Kr=삼육크와 인터뷰했다.
20
“딥시크는 자금을 모을 필요도 없고 계획도 없습니다.”
21
“엔비디아의 GPU는 이론적으로는 어떠한 기술 비밀도 없어서 복제하기 쉽다.”
22
“엔비디아의 GPU는 기술적 비밀이 없고 복제하기도 쉽지만 팀을 구성하고 혁신 문화를 조성하는 것이 어렵기 때문에 해자가 생기는 것입니다.”
23
“오픈AI는 신이 아닙니다. 항상 선두에 설 수는 없습니다.”
24
량원펑은 2024년 11월 딥시크-V3를 공개했다.
25
량원펑은 딥시크-V2 모델부터 전문가 혼합 방식=Mixture-of-Experts을 적용하기 시작했다.
26
전문가 혼합 방식은 개념 자체는 1990년대부터 제시됐다.
27
2020년 구글도 전문가 혼합 방식을 적용했다.
28
2024년 1월 메타도 라마 모델에 전문가 혼합 방식을 적용했다.
29
량원펑은 멀티 헤드 잠재 어텐션+전문가 혼합 방식을 믹스하면서=저비용 고효율 인공지능을 만들어냈다.
30
딥시크-V2 모델은 2360억 개의 매개변수를 갖고 있지만 필요한 전문가 영역만 활성화해서 210억 개의 매개변수로만 활용해서 추론한다.
31
딥시크-V2 모델은 경쟁 모델에 비해 메모리 사용량도 최대 13%까지 줄였다.
32
전문가 혼합 방식을 적용하면서 딥시크는 컴퓨터 사용 비용과 메모리 사용량을 획기적으로 줄이면서=저비용 고효율의 AI 추론이 가능하게 만들었다.
33
추론 비용이 토큰 100만 개당 1위안으로+라마3 70B 비용의 7분의 1이었고+GPT-4 터보 비용의 70분의 1이었다.
34
량원펑은 저가칩인 H800을 활용하는 대신 엔비디아 쿠다 플랫폼과는 별개인 명령어 어셈블리인 PTX를 통해 최적화했다.
35
량원펑은 H800의 일부 리소스가 연산이 아니라 통신에 할당돼서 낭비되고 있다는 걸 간파했다.
36
량원펑은 칭화대 출신 엔지니어 15명으로 구성된 엔비디아 GPU 최적화팀을 구성했다.
37
딥시크의 GPU 최적화팀은 쿠다의 중간 표현 언어인 PTX로 쿠다보다 더 H800을 세밀하게 제어하는데 성공했다.
38
량원펑과 딥시크 GPU 최적화팀은 GPU를 최적화시켜서 성능을 35%까지 향상시켰다.
39
량원펑은 딥시크-V3의 개발 보고서에서 개발 비용이 557만6000달러에 불과하다고 밝혔다.
40
량원펑은 딥시크-V3를 엔비디아의 저가칩인 H800 2000여 개로 개발했다고 밝혔다.
41
H800은 엔비디아가 미국의 대중 수출 규제를 피하기 위해 중국 수출용으로 개발한 저사양 제품이다.
42
메타의 오픈소스 생성AI인 라마3의 개발 비용은 7억2000만 달러로 추정되며+엔비디아의 최고 사양 GPU은 H100 2만4000개가 사용됐다.
43
량원펑은 딥시크-V3의 개발 비용에 딥시크의 인건비와 운영비는 포함시키지 않았다.
44
딥시크는 웨이신+타오바오+더우인 플랫폼의 14억 사용자 데이터를 이용했다.
45
딥시크의 데이터 수집 비용은 거의 0원이었다.
46
딥시크는 자오상은행+국가전력망 같은 중국 대기업들의 데이터도 직접 공급 받았다.
47
량원평은 14억 중국 인구의 빅데이터를 거의 무제한적으로 활용했다.
48
량원펑은 중국의 느슨한 개인정보 보호법 덕분에 미국에 비해 데이터 라벨링 비용을 미국의 10% 수준으로 지출했다.
49
딥시크는 바이두가 개발한 AI 훈련 플랫폼 패들패들을 활용했다.
50
딥시크는 중국 화웨이의 어센드 910B 칩을 활용했다.
51
어센드의 성능은 엔비디아 첨단칩 A100의 80% 수준이다.
52
어센드의 가격은 엔비디아 첨단칩 A100의 30% 수준이다.
53
화웨이 어센드를 활용하면+엔비디아 슈퍼칩 DGX A100 시스템 대비=비용이 54% 정도로 낮아진다.
54
량원펑은 중국 네이멍구와 구이저우의 데이터센터를 활용해서+전력 사용 비용을 미국의 3분의 1 수준으로 낮췄다.
55
량원평은 2024년 12월 이미지 생성 AI 야누스를 출시했다.
우여곡절 딥시크 창업
글로벌 딥시크 쇼크

량원펑