맥북으로 로컬에서 돌아가는 자율주행을 만들어봤습니다. 그리고 발견한 놀라운 사실
Drive Tech Odyssey
0:00 / 0:00
맥북으로 로컬에서 돌아가는 자율주행을 만들어봤습니다. 그리고 발견한 놀라운 사실
5 723 просмотра · 1 день назад
Drive Tech Odyssey
14,9 тыс. подписчиков
5 723 просмотра · 1 день назад
맥북 한 대로 자율주행 모델을 돌려서, 실제로 길 위를 달려봤습니다.
클라우드도 안 쓰고 인터넷도 안 씁니다. 카메라 위의 3D 상자, 탑뷰, 파란 경로선,
그리고 화면의 판단 문장까지 전부 이 맥북 안에서 만들어집니다.
열흘 동안 이걸 붙잡고 있었습니다. 세 가지를 이야기합니다.
하나, 이게 어떻게 돌아가는가. 둘, 그럼 진짜 차에 넣을 수 있는가. 셋, 이미 차에 넣은 사람들은 어떻게 한 건가.
그리고 만들면서 알게 된 것 하나 — 어려운 건 모델이 아니었습니다.
모델도 칩도 이제 공개돼 있습니다. 옮겨지지 않는 건 따로 있었습니다.
■ 이번 영상에서 다루는 것
· Qwen-Drive 4B의 부품 셋 — 언어 모델(VLM), 플래너, 인식 헤드. ②③이 ①의 특징으로 학습돼 있어서 ①을 바꾸면 탑뷰가 통째로 사라집니다
· MLX로 옮겼더니 탑뷰 3.4초 → 0.64초, 경로 계획 4.5초 → 1.4초. 8비트에서 품질 손실 없음. 빨라진 건 양자화가 아니라 프레임워크였습니다
· NVIDIA Alpamayo 2 Super(34B)를 맥에서 돌렸습니다 — 14초. torch로는 72GB라 애초에 안 올라가서, VLM만 MLX로 갈아 끼우고 KV 캐시를 전문가 쪽에 넘기는 다리를 만들었습니다
· 판단 문장의 첫 글자가 전부 제비뽑기였던 버그 — 난수 시드 직후 첫 값이 분포를 무시합니다
· 그럼 얼마나 빨라야 하나. 0.1초라는 잣대는 제가 정한 게 아니라 Alpamayo 2의 입력 규격에서 나옵니다
· 계산: 프리필 = 2 × 파라미터 × 토큰, 디코드 = 가중치 전체 ÷ 대역폭. 글자 하나를 뱉을 때도 64층을 통째로 다시 읽습니다
· 차에 실을 수 있는 칩(DRIVE AGX Thor)으로 34B는 8비트에서도 5.7초. 데이터센터 카드와 반대로 대역폭이 벽입니다
· 그래서 테슬라 FSD는 글을 쓰지 않습니다. 그 설계가 취향이 아니라 대역폭 계산의 결론이라는 이야기
· 현대차와 NVIDIA가 같은 시기에 한 말 — 증류, 그리고 증류로는 옮겨지지 않는 것
■ 영상에 나온 숫자
· Qwen-Drive 1.0 4B — 알리바바 2026년 8월 27일 공개(Apache 2.0)
· MLX 이식 후: 탑뷰 0.64초(카메라 1대) / 1.20초(3대), 경로 계획 1.4초
· 실차 주행 3회, 113분. 카메라 1대·3대 구성 모두 주행
· Alpamayo 2 Super 34B를 맥에서: 13.6~14.2초, 메모리 34GB
· 같은 주행에서 플래너만 바꿔 비교: Qwen-Drive 1.86초 / Alpamayo 1.5 4.65초
(두 구간의 도로가 428m 떨어져 있어 "몇 배"로 일반화하지 않습니다)
· 프리필 373 TFLOP, KV 캐시 토큰당 256KB
· 34B를 한 번 돌리는 데 걸리는 시간(제 계산): Thor 8비트 5.7초 / B200 1장 16비트 0.68초
· 테슬라 FSD v14 Lite 트립 가중치 0.88GB
■ 직접 해보실 분께
MLX 변환본(Apple Silicon)
· bf16 https://huggingface.co/drivetechodyss...
· 8-bit https://huggingface.co/drivetechodyss...
· 4-bit https://huggingface.co/drivetechodyss...
※ 4비트는 특징 추출 전용입니다. 질의응답에 쓰면 사진에 없는 것을 지어냅니다(모델 카드에 실측 표 있음)
Apple Silicon 패치 / MLX 이식
· https://github.com/drivetechodyssey-t... (apple-silicon · mlx-port 브랜치)
원본 모델은 알리바바 QwenLM이 공개한 Qwen-Drive-1.0입니다.
0:00 맥북으로 자율주행에 도전했습니다
1:00 사이버트럭에 맥북을 싣고 나간 첫 주행
1:55 화면 설명 — 탑뷰, 파란 경로선, 판단 문장
4:00 초기 빌드는 지연이 2초였습니다
6:00 카메라를 세 대로 늘렸더니 두 배 느려졌습니다
8:30 커널을 바꾸고 나서 — 속도 비교
10:00 오늘 할 이야기
12:00 Qwen-Drive의 부품 셋 — VLM · 플래너 · 인식 헤드
14:00 자동차 인터페이스는 휴머노이드보다 단순합니다
15:30 탑뷰를 만드는 인식 헤드, 그리고 그 비용
17:30 3D 화면은 누구를 위한 것인가 — 웨이모 · 죽스 시승
19:30 4초에서 시작했습니다 — MLX로 옮긴 이유
20:30 16비트에서 4비트로 내려도 인식률은 그대로
21:00 허깅페이스에 올려뒀습니다
22:00 NVIDIA Alpamayo 1.5와 2 Super
24:00 34B를 맥북에 올려봤습니다
25:30 14초, 차에서는 쓸 수 없습니다
26:00 모델 카드에 없던 것 — 첫 문장이 매번 랜덤이었습니다
27:00 1.5는 4.6초, 2는 14초 — 리즈닝의 차이
28:30 프리필과 디코딩은 따로 계산해야 합니다
29:30 그럼 어떤 기계가 필요한가 — Thor · H100 · B200
32:00 Alpamayo 2 Super는 차에 실으라고 만든 모델이 아닙니다
32:30 테슬라 FSD v14, 그리고 HW3의 v14 Lite
34:30 엔드투엔드가 정확히 무슨 뜻인가
37:00 하드웨어 비교 — 연산 능력과 메모리 대역폭
38:00 M5 Max는 스펙의 절반도 안 나옵니다
40:30 HW3에서 v14 Lite가 돈다는 것
42:00 얼마나 줄여야 했을까
44:00 리즈닝을 붙일 것인가, 뗄 것인가
47:00 현대차 AI 데이 — 레벨 2+와 하이페리온
50:30 가장 빨리 만드는 법은 이미 나와 있습니다
51:30 그럼 자율주행도 증류가 될까
55:30 베낄 수 없는 것 — 데이터 플라이휠
58:30 마무리