2026-07-25 @Alisvolatprop12 DeepSeek, 2026년 5월 20일 량원펑과 투자자 회의 녹취록 전문(한국어 번역) 3/3편 : 질의응…
Original Input
https://x.com/Alisvolatprop12/status/2080234273454346384?s=20
원문 제목: DeepSeek, 2026년 5월 20일 량원펑과 투자자 회의 녹취록 전문(한국어 번역) 3/3편 : 질의응답
TL;DR (LLM)
- (LLM 요약 생성 실패)
원문
@Alisvolatprop12 (Alis volat propriis) · 2026-07-23 10:11
좋아요 87 · RT 3 · 댓글 8 · 조회 9750
[X 아티클: http://x.com/i/article/2080232860938903552]
13. 질의응답 1 - 지속 학습, 생태계, 하드웨어
투자자 1:
량 대표님, 지속 학습이 언제쯤 돌파구를 만들 수 있을지 시간표를 조금 더 설명해 주실 수 있습니까? 지속 학습을 구현하려면 어떤 아키텍처와 알고리즘 혁신, 그 밖의 어떤 핵심 요소가 필요한지도 궁금합니다.
량원펑:
아직 이른 단계이고 연구가 더 필요합니다. 지금 전 세계가 이 문제를 연구하고 있습니다. 투자자 여러분의 눈에는 현재 에이전트가 가장 많이 보일 것입니다. 그러나 우리처럼 연구하는 사람들의 눈에는 ‘학습’과 학습 문제를 어떻게 해결할지가 더 크게 보입니다.
학습은 하나의 기술이라기보다 하나의 문제일 수 있습니다. 이 문제를 해결하는 기술은 여러 가지일 수 있습니다. 하나의 기술이나 하나의 단일 요소가 아닙니다. AGI 자체가 모델뿐 아니라 여러 요소로 이루어져 있는 것과 같습니다.
결국 공학 문제이자 알고리즘 문제이기도 합니다. 상당히 전문적인 주제이고, 접근법과 연구 방향도 많습니다.
투자자 2:
량 대표님, 감사합니다. 오늘 이런 기회를 주셔서 매우 감사드립니다. 먼저 도입부에서 하신 말씀에 깊이 공감했고 많은 영감을 받았다는 말씀을 드리고 싶습니다. 이 팀이 세상을 향한 큰 선의를 품고, 이 산업과 사회, 인류 지능의 발전을 조금이라도 진전시키고 기여하고자 한다고 말씀하셨습니다.
그 안에는 사명감과 비전이 있습니다. 저희가 일하는 회사의 기업문화인 ‘수기달인(修己达人)’, 즉 자신을 닦아 다른 사람도 뜻을 이루게 한다는 정신과 매우 닮았다고 느꼈습니다. 대표님이 왜 팀을 이끌고 오픈소스를 선택했는지 깊이 이해하게 됐습니다.
비유하자면 거대한 반얀나무가 새들의 낙원이 되는 생태계를 만드는 것과 같습니다. 만물에 이로움을 주되 다투지 않으면 모두에게 받아들여지고, 서로 공생하면서 결국 어디에나 존재하게 됩니다. 이번 투자를 통해 저희도 그 사명과 비전을 인정하고 지지하며 존중한다는 뜻을 전하고자 합니다.
앞으로 산업이 발전하는 과정에서 저희가 잘하는 영역을 통해 기여하고 싶습니다. 생태계를 함께 구축하는 문제에 관해 몇 가지 여쭙겠습니다.
현재 모델을 오픈소스로 공개한 뒤, 업계의 파트너·인재·팀 가운데 우리 모델과 성과를 충분히 재현할 수 있는 곳은 어느 정도입니까?
앞으로 생태계를 한 단계 더 발전시키려면 어떤 영역에서 더 많은 고급 인재가 필요합니까? 이들이 우리 모델을 이어받아 재현해야 합니까? 아니면 현재는 GPU 연산력 부족이 더 큰 문제입니까? 미래에는 여러 모델이 매트릭스 형태로 결합되는 생태계가 될까요?
예를 들어 우리가 기반 대형 모델을 계속 개선하고, 각 산업의 파트너와 팀이 그 위에 업종별 수직 모델이나 응용 모델을 만드는 구조를 생각할 수 있습니다. 현재 이 생태계는 어느 단계에 와 있으며, 2년이나 3년 뒤에는 어떤 모습으로 성장할 것으로 보십니까? 이것이 첫 번째 질문입니다.
두 번째 질문입니다. 방금 AI 하드웨어에 관한 여러 관찰도 공유해 주셨습니다. 글로벌 대형 AI 기업은 회사 한 곳이 1천억 달러 단위의 투자를 할 수 있는데, 중국은 현재 하드웨어 연산력에서 약점이 있는 것으로 보입니다.
이 문제는 어느 정도 시간이 지나야 해결돼 중국 AI 발전을 충분히 뒷받침하고, 하드웨어와 연산력의 약점이 AGI의 발목을 잡지 않게 될까요? 이것은 중국이 결국 반드시 달성할 과제이고, 시간과 자금 투입의 문제일 뿐이라고 보십니까?
동시에 두 방향이 함께 작동할 수도 있다고 생각합니다. 한편으로 모델이 발전하고 지능이 높아지면, 단일 과업이나 개별 지능 시스템이 필요로 하는 하드웨어와 연산량이 점차 줄어들 수 있습니다. 더 많은 연산을 무작정 투입하는 방식에서 더 영리하게 계산하는 방식으로 바뀌기 때문입니다. 제가 제대로 이해한 것인지 궁금합니다.
다른 한편으로 하드웨어 기술이 발전하면 연산 효율 자체가 높아집니다. 두 방향이 서로를 향해 다가가는 경로가 될까요? 현재 ‘960’이나 H200 같은 장비로 1천억 달러 단위의 투자를 한다고 가정하겠습니다. 대표님은 장비를 3년에 걸쳐 상각한다고 말씀하셨는데, 실제 기술 수명은 4년이나 5년 정도라고 보십니까?
더 직접적으로 말하면, 지금 데이터센터에 현재 세대 GPU로 1만 장 규모의 클러스터를 구축해도 3년 뒤에는 상대적으로 뒤처진 연산력이 될 수 있습니까? 지금은 건설 중이고 공급이 부족하지만, 3년 뒤에는 질이 낮아진 구형 연산력이 남아도는 상황이 생길 수 있는지 궁금합니다. 두 질문에 답변 부탁드립니다.
량원펑:
감사합니다. 우선 첫 번째는 생태계에 관한 질문입니다.
현재 거의 모든 기업이 인재 부족을 문제로 느끼는 것 같습니다. 그러나 이런 인재 부족은 단계적인 현상이라고 생각합니다. 어떤 산업이든 발전 초기에는 인재가 부족합니다.
과거 웹사이트를 처음 만들기 시작했을 때도 개발자가 매우 적었습니다. 이후 인터넷 서비스의 서버 측 개발 인재도 크게 부족했습니다. 그러나 이런 부족은 대개 2~3년 안에 빠르게 해소됐습니다. 많은 사람이 새로 양성됐기 때문입니다.
AI 인재 부족도 단계적인 현상입니다. 이미 부족이 크게 완화되고 있습니다. 실제로 AI 인재의 절대 수가 부족한 것은 아닙니다. 각 회사가 빠르게 사람을 양성할 수 있고, 인재 육성 속도도 상당히 빠릅니다. 따라서 생태계든 모델 회사든 AI 산업 전체에서 인재는 장기적인 병목이 아닙니다.
특정 인재의 부족은 반드시 단기 현상입니다. 역사적으로 한 종류의 인력이 장기간 계속 부족했던 적은 없습니다. 십여 년 전에는 조종사가 매우 부족하고 양성 기간도 길다고 했지만, 그 문제도 빠르게 해결됐습니다.
따라서 인재 부족을 지나치게 걱정할 필요는 없습니다. 오히려 현재 중국에는 모델을 만드는 회사가 너무 많습니다. 미국은 세 곳 정도인데, 중국에는 기반 모델을 만드는 회사가 지나치게 많습니다.
장기적으로 이렇게 많은 회사가 기반 모델을 만들 필요는 없고, 반드시 몇 곳으로 수렴할 것입니다. 지금은 자원이 여러 회사에 분산돼 있고, 어느 정도는 낭비되고 있습니다.
14. 기반 모델 기업은 결국 수렴합니다
량원펑:
중국에서는 모든 회사가 같은 일을 하려 하지만, 미국은 세 회사에 자원이 집중됩니다. 중국은 자원이 흩어져 있으므로 각 회사가 받는 몫도 더 적습니다. 이 구조는 반드시 수렴할 것입니다. 다만 과정에는 시간이 필요합니다.
지금은 모델 사업의 이익률이 매우 높다고 생각해 모두가 직접 하려 합니다. 그러나 실제로 이익률이 그렇게 높지 않다는 것을 알게 되면 상당수는 그만둘 수 있습니다. 저는 이 사업에 그렇게 높은 이익률이 존재한다고 믿지 않습니다. 객관적인 법칙에 맞지 않기 때문입니다.
어떤 산업이 비정상적으로 높은 이익률을 보인다면 그것은 현재 과도기적인 단계에 있다는 뜻입니다. 장기적으로는 합리적인 이익 수준으로 돌아가야 합니다. 이것이 현재 산업의 상황이고, 결국 수렴할 것입니다.
대형 모델을 만드는 영역에서 어느 한 회사가 “모든 이익을 내가 가져가겠습니다”라고 하는 것은 불가능합니다. 각 회사가 합리적인 이익만 얻는다면 그렇게 많은 회사가 모델을 만들 필요가 없습니다. 중국에서 세 곳이나 네 곳이 경쟁하면 경쟁은 이미 충분하고, 가격 경쟁도 강하게 일어날 것입니다.
대기업 두 곳과 소규모 기업 두 곳 정도면 기반 모델 시장에는 상당히 충분할 수 있습니다.
생태계가 구체적으로 어떤 모습이 될지에 관해서는 아직 특별히 많은 생각을 갖고 있지는 않습니다. 더 많은 사람을 지원하고 싶지만 우리에게 그만큼의 에너지는 없습니다. 지원할 의향이 있고 이해관계도 충돌하지 않지만, 실제로 어디까지 실행할 수 있는지는 별개의 문제입니다.
적어도 이해관계의 충돌은 없고, 우리는 협력과 상생을 바랍니다. 저는 대형 모델 회사가 산업 이익의 대부분을 가져갈 수 있다고 전혀 생각하지 않습니다. 불가능합니다. 모델 회사가 이렇게 많고, 회사별 차이도 그렇게 크지 않기 때문입니다.
차이를 만드는 것은 두 가지뿐입니다. 시간과 비용입니다. 따라서 어느 한 회사가 폭리를 얻는 구조는 되기 어렵습니다. 비용을 잘 통제하는 회사가 조금 더 벌고, 그렇지 못한 회사가 조금 덜 버는 정도일 뿐입니다.
첫 번째 질문에 답이 됐습니까?
참석자:
앞으로 많은 사람이 참여하고, 데이터와 애플리케이션이 순환적으로 반복 개선되는 구조가 될 것 같습니다. 감사합니다.
투자자 2:
지금 제 목소리가 들립니까? 감사합니다. 답변을 들으며 산업 생태계에서 DeepSeek가 취하려는 전략적 위치를 더 깊이 이해하고 존중하게 됐습니다.
데이터를 예로 들면, 공개 데이터는 대부분의 모델 회사가 이미 여러 경로로 확보할 수 있을 것이고, 방법 자체는 큰 문제가 아니라 시간과 비용의 문제라고 생각합니다.
향후 진정한 AGI 단계에 도달하면 모델이 스스로 반복 개선하고 학습하며, 자기 자신을 훈련하는 것이 이상적인 상태일 수 있습니다. 그때는 시뮬레이션 데이터나 합성 데이터를 충분히 활용할 수 있습니까? 아니면 실제 데이터의 품질이 가장 중요합니까?
계속 실제 데이터에 의존해야 한다면, AI 지능이 인간이 과거에 실제로 만들어낸 데이터의 범위에 갇히게 되지 않습니까? 반대로 시뮬레이션·합성·생성 데이터를 이용해 그 한계를 돌파하고, 인간이 과거에 만들어낸 모든 실제 데이터의 수준을 넘어설 수 있습니까?
량원펑:
넘어설 수 있다고 생각합니다. 적어도 일정한 범위에서는 가능합니다. 바둑을 예로 들면 AlphaGo는 인간이 한 번도 보지 못한 수를 두었습니다. 분명 특정 영역에서는 인간을 넘어설 수 있습니다.
물론 그 시스템에도 상한과 한계가 있을 수 있습니다. 다만 현재 우리는 그 한계를 보지 못하고 있습니다. 따라서 폭넓게 말하면, 인간이 이미 보유하고 언어로 표현할 수 있는 지식을 토대로 그 수준을 넘어설 수 있다고 봅니다.
투자자 2:
그 과정은 실제 데이터에 의존합니까, 아니면 시뮬레이션 데이터에 의존합니까? 실제로 작동할까요?
량원펑:
한 가지 방법만 있는 것은 아닙니다. 여러 방법이 있을 것입니다.
투자자 2:
알겠습니다. 감사합니다. 시간을 많이 사용했지만, 앞서 말씀드린 AI 인프라 질문도 이어서 여쭙고 싶습니다.
량원펑:
두 번째 질문이 정확히 무엇이었습니까? 조금 길어서요.
투자자 2:
짧게 다시 말씀드리겠습니다. AI 인프라에는 앞으로 회사마다 1천억 달러 단위의 투자가 들어갈 것으로 보입니다. 중국도 언젠가는 고효율 연산 하드웨어를 반드시 확보하겠지만, 현재 실무에서는 여전히 큰 제약입니다.
앞으로 두 방향이 동시에 진행될까요? 첫째, 모델 능력이 발전하면서 단순히 연산량을 밀어 넣는 ‘힘으로 계산하는 방식’에서 더 영리하게 계산하는 방식으로 바뀌어, 단위 모델이나 과업이 요구하는 연산량이 점차 줄어들 수 있습니다. 둘째, GPU 같은 하드웨어의 성능이 높아져 반복 개발 속도와 GPU 한 장당 효율이 계속 좋아질 수 있습니다.
그 과정에서 현재 H200이나 ‘960’ 같은 장비로 1만 장 규모의 클러스터를 구축해도 2~3년 뒤에는 상대적으로 질이 낮은 구형 연산력이 되는 현상이 나타날까요?
량원펑:
엔비디아 GPU는 기본적으로 5년 감가상각을 적용할 수 있습니다. 화웨이 GPU는 길어도 3년 정도로 보는 편이 맞을 것입니다. 화웨이 950은 올해 사용하기에는 상당히 좋고, 내년에도 괜찮을 것입니다. 그 이후에는 전력 소모가 너무 커질 수 있습니다.
화웨이 GPU의 수명주기는 분명 조금 더 짧습니다. 애초에 엔비디아보다 약 2년 뒤처져 있기 때문입니다. 다만 격차가 결정적으로 크다고 보지는 않습니다.
B200을 현재 합리적인 가격으로 확보할 수 있다면 수량과 관계없이 경제성이 있습니다. 텐센트나 알리바바도 합리적인 가격에 살 수 있다면 충분히 가치가 있습니다. 지금은 세밀하게 원가를 따질 때라기보다 물량 자체를 구하기 어려운 상황입니다.
우리가 연산력에서 뒤처져 있다는 것은 사실입니다. 이 격차는 몇 가지 방식으로 완화해야 합니다. 첫째, 어느 정도 모델의 지연을 감수하고 미국보다 작은 모델을 사용해야 합니다. 얼마나 작은 모델로 어느 수준까지 구현하느냐는 훈련 기술의 문제입니다. 모델 출시 시점의 지연과 더 작은 모델 규모를 받아들여야 합니다.
뒤처짐에는 한 가지 장점도 있습니다. 시간이 더 주어지고, 앞선 기술을 관찰한 뒤 더 영리한 방법을 사용할 수 있습니다.
15. 적은 연산력으로 시간 격차를 줄이는 서사
량원펑:
요약하면 우리는 미국보다 12개월, 12~18개월, 경우에 따라 6~12개월 정도 뒤처질 수 있습니다. 단순화해서 말하면 1~2년 뒤처진 상태에서 미국이 쓰는 연산력의 20분의 1만으로 같은 일을 만들어내는 서사입니다.
지금까지의 서사는 “1~2년 늦지만 20분의 1의 연산력으로 해냅니다”였습니다. 앞으로는 이 서사를 바꿔야 합니다. 미국의 몇 분의 1 수준의 연산력을 사용하면서도 시간 격차를 6개월, 3개월까지 줄여야 합니다. 그것이 하나의 목표입니다.
일부 영역에서는 미국을 넘어설 수도 있습니다. 그러나 전체 연산력에 자릿수 단위의 격차가 남아 있는 상황에서 전면적으로 추월하는 것은 현실적이지 않습니다. 대신 선택과 집중을 통해 중요한 일부 영역에서 넘어서는 것은 가능합니다.
투자자 2:
알겠습니다. 감사합니다, 량 대표님. 함께 노력하겠습니다. 다른 분들을 위해 여기서 마치겠습니다.
투자자 3:
방금 공유해 주신 내용에 감사드립니다. 두 가지 기술 질문을 짧게 드리겠습니다.
앞서 기술 로드맵을 설명하면서 현 단계의 핵심 과제가 지속 학습이라고 말씀하셨습니다. 해외에서도 ‘Recursive Improvement’라는 이름으로 연구가 활발한 주제입니다. 현재 기술적으로 가장 큰 난점은 무엇이며, 대표님 관점에서는 언제쯤 해결될 수 있다고 보십니까? 이것이 첫 번째 질문입니다.
두 번째로, 지속 학습을 먼저 해결한 뒤 일반지능으로 간다고 말씀하셨습니다. 그 순서의 기술적 근거가 무엇인지 궁금합니다. 지속 학습을 해결한 뒤 DeepSeek가 범용지능을 본격적으로 추진한다는 뜻입니까?
량원펑:
기술 문제를 설명하기가 조금 어렵습니다. 가장 큰 난점은 아직 실제로 잘 작동하는 방법을 찾지 못했다는 것입니다. 전 세계 어디에서도 좋은 방법을 찾지 못했고, 모두가 탐색 중입니다. 누가 다음 해법을 먼저 찾아낼지 알 수 없습니다.
아직 탐색 단계입니다. 여러 아이디어가 있고 현재로서는 유망해 보이는 방향도 많지만, 어느 것도 끝까지 관통해 해결하지는 못했습니다. 이것이 첫 번째 질문에 대한 답입니다.
두 번째로, 현재 내부에서 중요하게 보는 서사가 있습니다. 다음 모델을 훈련할 때 그 모델이 우리의 개발을 도울 수 있어야 한다는 것입니다. DeepSeek 자체의 효율을 높이고, 다음 모델을 개발할 때 더 많은 도움을 제공해야 합니다.
더 간단히 말하면, 우리가 만드는 모델의 첫 번째 목표는 모두가 쓰기 좋은 모델이 되는 것이 아니라 우리 자신이 쓰기 좋은 모델이 되는 것입니다. 먼저 우리에게 유용해야 합니다. 그래야 다음 모델을 더 빠르게 개발할 수 있습니다.
회사 내부의 많은 사람이 그렇게 생각합니다. 우선 우리에게 유용해야 하고, 먼저 우리가 사용해야 합니다. 이것이 AGI를 가장 빨리 실현하는 방법입니다. 우리가 쓰기 좋은 모델이라면 다른 사람에게도 유용할 가능성이 큽니다. 그러나 먼저 우리에게 충분히 유용한지를 보장해야 합니다.
이 서사가 조금 이상하게 들릴 수 있지만, 실제로 많은 구성원이 그렇게 생각합니다. 단순히 일반 사용자의 사용성을 높이기보다 우리 연구에 더 큰 도움을 주기를 바랍니다. 그러면 AGI를 훨씬 빠르게 실현할 수 있습니다. 이 논리의 목적은 모델이 우리를 도와 AGI를 만들게 하는 것입니다.
우선 우리 자신이 AGI를 실현하는 데 도움을 받아야 합니다. 지금은 AI의 도움 없이 AGI를 만들기 어렵다는 점이 매우 분명합니다. 아직 AI가 완전히 자율적으로 일하는 것은 아니고 인간과 협력하는 수준이지만, 이미 매우 유용합니다.
투자자 3:
두 번째 질문을 조금 더 분명히 하겠습니다. 지속 학습을 먼저 해결하고 그다음 범용지능으로 간다는 것이 향후 경로에 대한 예상입니까? 왜 지속 학습이 먼저여야 하는지 기술적 근거를 설명해 주십시오.
량원펑:
지속 학습을 해결하면 우리의 연구개발 속도를 크게 높일 수 있기 때문입니다. 지속 학습을 먼저 구현하면 범용지능은 훨씬 쉬운 문제가 됩니다. AI의 보조를 받을 수 있고, 지속적으로 학습하는 AI라면 능력이 매우 강할 것입니다.
현재 에이전트의 능력이 제한되는 이유는 지속 학습을 하지 못하고, 효과적으로 계속 학습할 수 없기 때문입니다. 지속 학습을 먼저 완성하면 AI의 능력이 크게 높아지고, 우리 연구의 효율도 대폭 향상됩니다.
지속 학습을 먼저 만들면 범용지능은 그 AI를 이용해 훨씬 쉽게 개발할 수 있습니다. 우리가 바라는 결과는 바로 이것입니다. 우리에게 일이 적어지고 과정이 수월해집니다. 반대로 지금 사람이 직접 범용지능의 모든 부분을 만들려 하면 매우 힘들고 고된 작업이 됩니다. 데이터와 인력을 많이 필요로 하고 비용 대비 효율도 낮습니다.
투자자 3:
공유해 주셔서 감사합니다.
사회자:
온라인 질문 하나를 확인해 주십시오. 채팅창에 “AGI까지 얼마나 더 걸리며, 그 안에 중국산 하드웨어가 따라잡을 수 있습니까?”라는 질문이 있습니다.
Zoom 회의 채팅창에 올라와 있습니다.
량원펑:
네, 확인했습니다.
현재 화웨이는 우리에게 화웨이 950 약 1만 6천 장을 배정했습니다. 이 정도 수치는 공개해도 될 것 같습니다. 인터넷 대기업이 받는 물량보다 한 자릿수 정도 적습니다. 가격도 싸지 않고, 화웨이가 우리에게 줄 수 있는 물량도 그 정도입니다.
인터넷 대기업은 더 큰 규모를 추구하고 실제 수요도 더 큽니다. 우리는 일부 비공식 유통 경로의 GPU도 확보할 수 있습니다. 우리가 화웨이 950을 구매하는 목적에는 화웨이 생태계가 자리 잡도록 돕는 의미도 있습니다.
화웨이 950 1만 6천 장은 B 시리즈 GPU 약 4천 장에 해당합니다. 아주 큰 물량은 아니고 전략적 의미도 제한적입니다. 차세대 모델을 훈련하기에는 부족하고, 현재 세대 모델을 훈련할 정도입니다. 다만 화웨이가 이 생태계를 먼저 완성하도록 돕는 데는 의미가 있습니다.
그다음 질문은 AGI까지 얼마나 걸리며, 그 안에 중국산 하드웨어가 따라잡을 수 있느냐는 것입니다.
현행 패러다임의 AI 모델만 놓고 보면 중국은 1~2년 안에 해외와 비슷한 수준에 도달할 수 있다고 생각합니다. 어쩌면 올해 안에 해외 모델을 실질적으로 대체할 수준에 이를 수도 있습니다. 현재 방식과 현재 패러다임에서는 그렇게 어려운 일이 아닙니다. 올해 안에도 가능할 수 있습니다. 다만 그것은 아직 AGI가 아닙니다.
16. AGI, 조직 확대, 차세대 모델
량원펑:
적어도 AGI라고 부르려면 지속적으로 학습할 수 있어야 한다고 생각합니다.
중국산 하드웨어가 그때까지 따라잡을 수 있느냐고 묻는다면, 몇 년은 필요할 가능성이 큽니다. 우선 생태계 문제를 해결해야 합니다. 생태계는 기술 문제이면서 신뢰의 문제입니다. 생태계를 해결한 뒤 생산능력 문제를 해결해야 하고, 두 문제는 단계적으로 풀릴 수 있다고 봅니다.
5년 뒤에도 생산능력 때문에 막혀 있을 것이라고는 생각하지 않습니다. 현재는 분명 생산능력이 병목입니다. 올해와 내년, 그다음 해까지도 그럴 수 있습니다. 그러나 5년 뒤에는 반드시 그렇지는 않을 것입니다. 저는 비교적 낙관적입니다.
다음 질문은 향후 조직구조와 인력 규모 계획에 관한 것입니다. 과거 우리의 조직구조는 매우 분산돼 있었습니다. 사실 명확한 조직구조가 없었다고 할 수 있습니다. 그러나 규모가 더 커지면 분명 변화가 필요합니다.
현재로서는 많은 변화가 필요하다는 정도만 말씀드릴 수 있고, 모든 내용을 한 번에 명확히 설명하기는 어렵습니다. 최종적으로는 여러 부문으로 나뉠 것입니다. 일부 부문에는 비교적 엄격한 계층 구조가 필요하고, 다른 부문은 느슨하고 수평적인 구조를 유지할 수 있습니다.
인원이 늘어남에 따라 조정할 것입니다. 사실 곧 조정해야 하고, 이미 시작했습니다. 조정하지 않으면 많은 일을 추진할 수 없습니다. 명확한 조직구조가 필요한 부문이 분명히 있습니다.
또 어떤 모델 버전에 관한 질문이 있습니다. 현재 온라인에 공개한 해당 버전은 아직 비교적 거칠고, 능력을 개선하려면 시간이 더 필요합니다.
제가 편안하다고 느끼는 출시 주기는 대략 2~3개월에 한 번입니다. 이전 버전은 4월 말쯤 나왔고, 다음 버전은 6월 말쯤이 될 수 있습니다. 특별한 변수가 없다면 버전이 올라갈수록 계속 좋아질 것입니다.
활성 파라미터 50B 규모에서는 최종적으로 현재 공개된 주요 오픈소스 모델들과 큰 차이가 나지 않을 수 있습니다. 추론 속도와 성능 모두 아주 큰 격차는 없을 것으로 봅니다.
그러나 비공개 대형 모델과는 여전히 격차가 클 것입니다. 현재 활성 파라미터 규모로는 그 수준에 도달하기 어렵고, 150B 정도의 더 큰 모델이 필요할 수 있습니다.
150B 모델은 현재 훈련 진척을 기준으로 낙관적으로 보면 올해 말에 훈련을 시작할 수 있습니다. 늦어도 내년의 어느 시점이 될 수 있습니다. 아직 격차는 상당합니다. 이것이 원문에서 ‘OCE’로 전사된 모델·시스템과의 격차입니다.
투자자 4:
안녕하세요. 대표님은 AGI가 갑작스러운 도약이 아니라 점진적으로 실현되는 과정이라고 자주 말씀하셨습니다. 그렇다면 명확한 임계점이 없는 과정이라고 이해해도 됩니까?
량원펑:
명확한 임계점은 없지만 비선형적인 과정입니다. 우리가 현재 비교적 강하게 믿는 서사는 AI가 AI 연구를 가속할 수 있다는 것입니다. AI를 이용해 자기 자신의 연구를 더 빠르게 할 수 있으므로 발전은 선형적이지 않습니다. 뒤로 갈수록 비선형적으로 빨라질 수 있습니다.
투자자 4:
알겠습니다. 그렇다면 앞선 말씀의 결론은 언어모델을 계속 스케일링하는 것만으로도 그 단계에 도달할 수 있다는 뜻으로 들립니다.
량원펑:
언어모델 스케일링에 상한이 보이지 않는다고까지는 말씀드릴 수 있습니다. 현재 우리가 도달한 수준에서도, 미국이 도달한 수준에서도 아직 상한은 보이지 않습니다.
투자자 4:
앞서 미국은 활성 파라미터 800B 모델을 훈련할 수는 있어도 실제로 활용하기는 어렵다고 말씀하셨습니다. 훈련은 가능하지만 비용이 너무 높아 일반 사용자에게 제공하기 어렵다는 뜻으로 이해했습니다.
제가 오래전부터 궁금했던 점이 하나 있습니다. 인간이 언어 능력을 갖게 된 것은 최근 약 10만 년의 일이고, 그 이전에는 약 37억 년에 걸친 진화가 있었습니다. AI 훈련에서는 대표님이 말씀하신 것처럼 그 순서를 거꾸로 갈 수도 있겠지만, 언어모델의 상한에 도달한 뒤에는 결국 이른바 월드 모델, 물리 세계 모델 또는 체화 영역으로 들어가야 하지 않습니까?
량원펑:
맞습니다. 결국 체화 영역으로 들어가야 합니다. 우리 회사의 관점에서도 지능의 종착점은 자연스럽게 체화지능일 가능성이 큽니다.
보통 사람에게 필요한 것은 컴퓨터 자체가 아닙니다. 사람은 먹고 마시고 생활하며 이동하는 데 컴퓨터를 직접 필요로 하는 것이 아닙니다. 실제로 필요한 것은 구체적인 인력을 대신해 줄 능력입니다. 사람의 노동 수요를 해결하는 것이 목표라면 체화지능은 피할 수 없습니다.
투자자 4:
그렇다면 중간 단계에서 AI가 자기 진화와 반복 개선을 충분히 수행할 수 있는 수준에 도달했을 때, 가장 먼저 어떤 형태로 현실에 적용되기를 바라십니까?
량원펑:
지금과는 다를 수 있습니다. 체화지능이 아직 없다고 가정하면, 우리가 AGI에 기대하는 첫 번째 역할은 다음 버전의 모델을 개발하도록 돕는 것입니다. 다음 모델을 반복 개발하게 하는 것입니다.
체화지능까지 갖추고 나면 그다음 세대의 체화 시스템, 즉 다음 세대 로봇을 AI가 직접 개발하기를 바랍니다.
투자자 4:
한 가지 더 궁금합니다. 과거 DeepSeek 인터뷰를 보면 중요한 연구 방향을 선택할 때 단순한 공학적 최적화보다 안목과 직관이 중요하다고 말씀하신 것으로 기억합니다. AI가 자기 진화를 할 수 있게 된 뒤에도 이런 안목, 취향, 직관이 여전히 중요합니까? 그렇다면 무엇이 중요해집니까?
량원펑:
현재 AI에는 안목과 직관이 부족하지 않습니다. 부족한 것은 지속 학습 능력입니다. AI의 안목과 직관에는 큰 문제가 없습니다. 예를 들어 글을 쓰게 해보면 안목과 직관이 충분히 작동한다고 생각합니다.
앞에 질문이 몇 개 더 있었는데 화면에서 확인해 보겠습니다. 아까 몇 가지가 보였는데 지금은 보이지 않습니다.
사회자:
량 대표님, 화면에 남겨둔 질문을 다시 읽어드리겠습니다. 지속 학습은 여러 연구자가 아직 해결되지 않은 연구 문제라고 말합니다. 반면 코딩 에이전트, 특히 원문에 ‘MILES’로 전사된 목표를 따라잡고 ‘Office’ 또는 ‘MIS’ 수준까지 스케일링하는 것은 상대적으로 확실한 목표로 보입니다.
- 탐색적 연구, 환각, 데이터 라벨링
사회자:
해결되지 않은 연구 목표와 비교적 확실한 스케일링 목표 사이에서 연구 자원, 특히 연구 인력을 어떻게 배분해야 가장 좋은 균형과 효과를 얻을 수 있다고 보십니까?
량원펑:
‘모델 Office’로 전사된 목표는 비교적 확실한 목표라고 봅니다. 그러나 ‘모델 MIS’는 아직 확실하다고 말하기 어렵고, 하나의 목표라고만 할 수 있습니다. ‘모델 Office’ 쪽은 비교적 확실해 보입니다.
CoT나 이런 탐색적 연구는 자원을 많이 쓰지 않습니다. GPU를 거의 소모하지 않고, 아주 적은 연산력만 필요합니다. 필요한 것은 아이디어입니다. 누군가가 하나의 정식 프로젝트로 계속 붙잡고 있어야 하는 일도 아닙니다. 많은 사람이 평소에 이 문제를 함께 생각하면 됩니다.
따라서 별도로 많은 자원을 배정할 필요가 없습니다. 모델을 실제로 훈련하고, 제작하고, 출시하며, 효율 실험을 할 때는 자원이 필요합니다. 그러나 방금 말씀드린 탐색적 연구는 사람과 GPU 모두 거의 소모하지 않습니다.
우리는 이런 연구를 ‘복권 긁기’라고 부릅니다. 진입장벽은 낮고 누구나 시도할 수 있습니다. 다만 누가 무엇을 찾아낼지는 알 수 없습니다. 재능의 문제인지, 다른 무엇의 문제인지도 확실하지 않습니다.
그래서 이 영역에서는 자원을 특별히 배분할 필요가 없습니다. 다른 회사와의 차이는 우리가 이 문제를 계속 토론하고 생각하며 중요한 문제로 취급한다는 점입니다.
회사 안에서 이것은 중요한 문제이고, 시간을 들여 사고할 주제입니다. 그러나 많은 자원을 투입해야 하는 문제는 아닙니다.
다음 질문은 대형 모델의 환각이 사용자 경험에 큰 영향을 준다는 것입니다. 환각 문제에도 해결 방법은 있습니다. 다만 장기간에 걸쳐 풀어야 할 문제입니다. 더 나은 포스트트레이닝을 통해 해결하거나 상당히 개선할 수 있는 문제라고 봅니다.
지금까지 업계가 이 문제에 아주 큰 힘을 들이지 않았을 뿐입니다. 제게도 환각은 문제입니다. 다만 내부적으로는 주로 제품 문제로 분류합니다. 해결해 나가겠지만 핵심 과제로 두지는 않습니다.
앞서 데이터 라벨링에 관한 질문도 있었습니다. 데이터 라벨링은 우리의 자본 투입 구조와 관련돼 있습니다. 현재의 자본 구조로는 대규모 고품질 데이터 라벨링 비용을 감당하기 어렵습니다. 비용이 매우 높기 때문입니다.
미국의 데이터 라벨링 비용과 중국의 비용에는 큰 차이가 없습니다. 중국에서 데이터를 라벨링한다고 해서 비용 우위가 생기지 않습니다. 특히 고난도·고품질 데이터에서는 비용 우위가 거의 없습니다. 따라서 미국 기업처럼 대규모로 투자하기 어렵습니다. 외주로 하든 내부에서 하든 중국에서도 데이터 라벨링은 매우 비쌉니다.
그래서 현재는 두 경로를 함께 사용합니다. 데이터를 전혀 라벨링하지 못한다는 뜻은 아닙니다. 라벨링 비용이 낮은 데이터와 높은 데이터가 있으므로, 우선 비용이 낮은 것부터 합니다.
현재 회사 인력의 절반이 데이터 라벨링에 관여한다고 말해도 됩니다. 핵심 연구원, 가장 중요한 연구 인력 가운데도 상당수가 데이터 라벨링을 하고 있습니다. 현 단계에서 AI 문제를 해결하는 핵심은 결국 데이터이므로, 여기에 집중하고 있습니다.
투자자 5:
량 대표님, 감사합니다. 말씀에 깊이 공감했습니다. 몇 가지 질문을 드리겠습니다.
첫째, 중국 모델은 미국 모델보다 효율 면에서 분명 강점이 있다고 하셨습니다. 그 밖에도 미래에 미국보다 강해질 수 있는 영역이 있다고 말씀하셨는데, 지능이나 다른 측면에서 중국이 구조적으로 우위를 가질 수 있는 영역은 무엇입니까?
량원펑:
여러 사용자 경험 영역에서는 중국이 미국보다 더 잘할 가능성이 있습니다. 우리 제품만 두고 하는 말이 아니라, 중국 기업의 사용자 경험이 미국보다 반드시 뒤처질 이유는 없다고 봅니다.
제품 역량도 미국보다 약하다고 볼 필요가 없습니다. 비용은 미국보다 낮을 가능성이 큽니다. 따라서 중국 AI는 충분한 경쟁력을 가질 수 있습니다.
그 밖에 다른 구조적 우위가 있는지는 확실하지 않습니다. 그러나 비용과 제품, 두 영역에는 분명 일정한 구조적 우위가 있습니다.
비용 우위는 이해하기 쉽습니다. 미국 기업은 비용을 극단적으로 낮춰야 할 필요가 적으므로 그런 역량을 적극적으로 발전시키지 않습니다. 우리만큼 중요하게 여기지 않습니다. 우리는 비용을 매우 중요한 문제로 볼 수 있지만, 그들에게는 우선순위가 낮습니다.
제품도 마찬가지입니다. 중국의 여러 기업이 축적한 제품 역량은 충분히 강합니다. 그래서 비용과 제품, 이 두 측면에는 구조적 우위가 있을 수 있습니다.
투자자 5:
두 번째 질문입니다. 방금 포스트트레이닝은 상대적으로 비용이 많이 들고, Anthropic과 OpenAI도 막대한 금액을 투입한다고 말씀하셨습니다. 이번 투자 유치 이후 포스트트레이닝 투자를 확대할 계획입니까?
량원펑:
주요 격차는 고품질 데이터 라벨링과 AI 연구에 있습니다. 투자는 분명 확대할 것입니다. 다만 고품질 데이터 라벨링의 병목은 전형적인 자본 부족 문제가 아닙니다.
고품질 데이터 라벨링의 가장 큰 병목은 시간입니다. OpenAI, Anthropic을 비롯한 해외 기업은 더 일찍 시작했고 자본과 GPU도 더 많았습니다.
중국은 본격적으로 시작한 지 최근 반년 정도라고 볼 수 있으므로 시간이 더 필요합니다. 추가 자본과의 관계는 생각보다 크지 않습니다. 기존 자본만으로도 이미 가능한 최고 속도로 조직을 확대할 수 있기 때문입니다.
다만 확대 속도에는 상한이 있습니다. 돈이나 GPU가 당장 부족해서 사람을 늘리지 못하는 것은 아닙니다. 조직이 실제로 빠르게 확대되는 데 물리적인 시간이 필요합니다.
따라서 1년 안에 중국도 고품질 데이터 문제를 상당히 잘 해결할 수 있을 것으로 기대합니다. 전망이 그렇게 비관적인 것은 아니지만, 실제로 시간이 필요합니다.
투자자 5:
감사합니다. 세 번째 질문입니다. Anthropic은 자체 모델로 금융·법률 등 여러 수직형 제품을 만들고 있고, 앞으로 의료 영역에도 진출하려는 것으로 보입니다. DeepSeek도 어느 단계에서는 이런 수직형 애플리케이션을 고려할 수 있습니까?
18. 코딩 에이전트와 상업화의 안전판
량원펑:
중국에서 앞으로 어떤 비즈니스 모델이 형성되고 어떤 경로가 가장 순조로울지 아직 충분히 생각이 정리되지 않았습니다. 아직 그 단계에 도달하지 않았습니다. 중국과 해외의 상황이 반드시 같지는 않으므로, 중국 시장이 실제로 어떤 모습이 될지는 지금 판단하기 어렵습니다.
현재 중국의 상황만 놓고 보면 가장 합리적인 선택은 범용 에이전트에 전력을 다하는 것입니다. 금융이나 의료 같은 분야별 에이전트의 우선순위는 더 낮아야 합니다. 먼저 코딩을 해야 합니다. 코딩 에이전트는 많은 일을 할 수 있고, 다른 수직형 에이전트의 개발도 도울 수 있습니다. 현 단계에서 가장 중요한 것은 여전히 코딩 에이전트입니다.
투자자 5:
매우 명확합니다. 감사합니다. 한 가지 더 여쭙겠습니다.
DeepSeek가 지금까지 매우 순수한 연구 방식으로 회사를 이끌어온 점을 높이 평가합니다. 그러나 이 산업도 이미 자본시장과 자본화의 경로로 들어섰습니다. 대표님은 동료와 투자자 모두에게 책임감이 강한 분입니다.
순수한 연구와 AGI라는 방향, 그리고 자본시장 사이의 균형을 앞으로 어떻게 맞출 생각입니까? 향후에도 자본시장을 활용하고 상장 같은 공개시장 경로를 고려해야 할 텐데, 이 문제를 어떻게 보고 계십니까?
량원펑:
두 가지를 함께 달성할 수 있다고 생각합니다. 올해 B단 매출이 수억 달러에 이르고 C단 사용자 기반도 유지된다면, 그것만으로도 일정한 상업적 기반이 생깁니다. 내년에 B단 수요가 더 커지면 회사는 순이익에 상당히 가까워지거나 실제 순이익을 낼 수도 있습니다.
그때는 단순히 현금을 소진하는 단계가 아니므로 선택할 수 있는 행동의 폭이 상당히 넓어집니다. 최악의 경우에도 API 판매만으로 상장회사를 지탱할 수 있을 가능성이 있습니다. 기술이 앞으로 더 발전하지 않고 현재 수준에서 완전히 멈춘다고 가정해도, API 판매와 서비스 운영에 전력을 다하면 사업으로서 충분할 수 있습니다.
그래서 저는 자신이 있습니다. 실제로 그렇게 어렵지 않습니다. 레버리지가 매우 높은 지점에 있고, 빠르게 성장하는 산업에 있기 때문입니다. 우리는 더 큰 꿈을 바라지만, 동시에 최소한의 안전판이 될 수 있는 실적도 확보할 수 있습니다.
투자자 5:
좋은 답변 감사합니다. 질문은 여기까지입니다.
투자자 6:
공유해 주셔서 감사합니다. 앞서 언급된 조직 문제를 조금 더 여쭙고 싶습니다. DeepSeek와 다른 회사의 가장 큰 차이는 조직, 또는 조직 형태에 있다고 생각합니다.
조직 형태는 목표와 관련돼 있지만, 조직 자체의 경계와 효율도 고려해야 합니다. 거시적으로 볼 때 우리가 참고할 만한 좋은 역사적 모델이 있습니까? Bell Labs 같은 조직이 이상적인 형태입니까? 아니면 적절한 모범답안이 없고 우리가 점진적으로 탐색해야 합니까?
새로운 시대에는 결국 스스로 탐색해야 할 수도 있다고 생각합니다. 우리의 조직 형태는 미국의 주요 회사들과도 분명 다릅니다. 미국의 세 회사도 서로 다르지만, 적어도 상업 회사의 관점에서 조직을 설계합니다. 조직 문제를 중심으로 답변을 듣고 싶습니다.
량원펑:
우선 우리에게는 모방할 대상이 없습니다. 모든 단계에서 실제 상황을 출발점으로 삼고, 사실에 근거해 판단하며, 현실에 맞는 결정을 내려왔습니다. 따라서 우리의 조직은 시대가 만든 산물이고 현실 조건에 대한 반응이지, 누군가를 모방한 결과가 아닙니다.
현재 조건에서 우리가 선택한 형태가 최적해에 가깝다고 판단한 것입니다. 모든 단계에서 충분히 생각하고 여러 선택지를 검토했습니다. 누군가가 이렇게 했기 때문에 따라 한 것이 아니라, 장단점을 분석한 결과 이 길을 선택했습니다.
미래에도 같을 것입니다. 특정 조직을 모방하지 않을 것입니다. Bell Labs와도 다릅니다. Bell Labs는 상업화를 직접 책임질 필요가 없는 구조였습니다. 그러나 우리는 분명 상업화를 해야 합니다. 결국 살아남아야 하고, 우리는 회사입니다. 정부가 우리에게 돈을 주는 것도 아닙니다.
원대한 사명을 가질 수는 있지만, 근본적으로는 회사이므로 어떻게 생존할지 생각해야 합니다. B단 사업은 장기적으로 분명 중요합니다. 미래에는 그 수익으로 살아야 할 수도 있습니다. 지금 당장 최우선이 아닌 이유는 현재로서는 주로 비용만 드는 단계이기 때문입니다.
그래서 Bell Labs와는 다릅니다. 우리는 본질적으로 회사입니다. 역사적으로 이익 외의 목표를 가진 회사는 많았습니다. 이익을 넘어서는 목표가 있다고 해서 회사가 아닌 것은 아닙니다.
많은 위대한 회사는 이익 이외의 목표를 가졌기 때문에 위대해졌습니다. 그런 목표가 상업화를 방해한 것이 아니라 오히려 더 잘하게 만들었습니다. 우리도 본질적으로 회사입니다. 다만 어떤 돈을 벌 것인지, 언제 벌 것인지, 얼마나 벌 것인지, 무엇으로 벌 것인지에 관해 선택과 집중을 하는 것입니다.
투자자 7:
량 대표님, 두 가지를 짧게 여쭙겠습니다.
첫째, 방금 원문에 ‘MILOS’로 전사된 목표는 아직 확실하지 않지만 그 방향으로 연구할 것이라고 말씀하셨습니다. 또한 차세대 모델의 활성 파라미터가 150B에서 250B 정도가 될 수 있다고 하셨습니다.
19. TileLang과 추론 효율
투자자 7:
그렇다면 150B~250B 모델은 원문에 ‘O4.7’로 전사된 시스템을 목표로 합니까, 아니면 다른 모델을 기준으로 합니까?
둘째, 추론 과정에서 CUDA 외의 컴파일 언어를 사용한다고 말씀하셨습니다. 기존 엔비디아 생태계에서는 PTX를 많이 사용했을 것으로 이해합니다. TileLang 같은 언어를 더 많이 사용하면 추론 효율이 크게 낮아지거나 단기적인 성능 손실이 생기지 않습니까?
컴파일 언어 전환으로 생기는 효율 손실을 어떻게 보십니까? 장기적으로 보완 가능한 손실입니까, 아니면 오히려 효율을 높이는 방향입니까?
량원펑:
효율을 높이는 방향입니다. 그것도 크게 높입니다.
투자자 7:
오히려 부정적인 영향이 거의 없습니까?
량원펑:
맞습니다. 효율을 크게 높입니다. 그래서 이것은 하나의 기회입니다. 과거에는 CUDA 생태계에서 벗어날 수 없었지만, 이제는 그 생태계를 버리고 TileLang이라는 더 단순한 방법을 사용할 수 있습니다.
TileLang은 고급 언어라 프로그램 작성 속도가 빠르고 필요한 코드량도 매우 적습니다. 따라서 기존 구현을 다시 작성하는 것도 가능합니다.
투자자 7:
알겠습니다. 그러면 이 변화는 단기적으로 보완해야 할 약점이 아니라, 앞서 말씀하신 AI와 기술 발전이 만든 큰 기회라고 이해하면 됩니까?
량원펑:
맞습니다. 기술 발전이 만든 큰 기회입니다. 다만 이것을 단순히 AI가 준 기회라고만 할 수는 없습니다. 별도로 AI를 이용해 TileLang 코드를 작성하는 프로젝트도 진행하고 있습니다.
투자자 7:
그렇게 하면 더 빨라집니까?
량원펑:
현재 TileLang 코드는 모두 사람이 작성하고 있습니다. 그 상태에서도 기존에 CUDA 코드를 작성하는 것보다 훨씬 빠릅니다.
투자자 7:
하드웨어 최하단의 실행 효율에도 사실상 영향이 없다고 보십니까?
량원펑:
성능 손실은 1~2% 정도입니다. 그 정도는 충분히 받아들일 수 있습니다.
투자자 7:
알겠습니다. 매우 명확합니다. 감사합니다.
사회자:
다른 질문이 있습니까? 없다면 오늘 회의는 여기까지 하겠습니다. 모두 시간 내주셔서 감사합니다. 량 대표님께도 감사드립니다.
참석자들:
감사합니다. 안녕히 계십시오.
읽느라 고생하셨습니다. 여기까지 읽은 모든 분에게 축복이 함께 하길…