Qwen 3.8 27B Q6 CUDA 가능한 가성비 끝판왕 세팅으로 LLM 구동기 수정 개발 모두 보여드림
소울시커 Soul Seeker
0:00 / 0:00
Qwen 3.8 27B Q6 CUDA 가능한 가성비 끝판왕 세팅으로 LLM 구동기 수정 개발 모두 보여드림
4 165 просмотров · 3 часа назад
소울시커 Soul Seeker
17,7 тыс. подписчиков
4 165 просмотров · 3 часа назад
로컬LLM 끝판왕 모델인 Qwen 3.8 27B Q6, CUDA로 가장 가성비 있게 돌리는 방법은?
가성비 구성으로 헤르메스 에이전트로 LLM 런처 프로그램 기능 개선 개발시키는 과정을 모두 담았습니다.
※ 영상 내 중고 가격은 녹화 시점 기준이며, 시세는 항상 변동될 수 있습니다.
━━━━━━━━━━━━━━━
이 채널이 더 알려졌으면 하시는 분들은 "구독" "좋아요" "Hype" 부탁드립니다.
━━━━━━━━━━━━━━━
💡 관련 영상 (재생목록 : • AI & LLM )
━━━━━━━━━━━━━━━
• 홈 로컬 AI (LLM) 구축을 위한 사전 준비 | 메인보드 잘 선택 하기
• 비싼 그래픽카드로 게임만? 로컬 AI를 돌려보자 / gemma4, qwen3.6
• 로컬 AI 전력소비, 생각한 것 보다 적은데? 왜 그럴까? 실측결과 및 결과분석
• VRAM만 중요한줄 알았더니.. CPU가 OFFLOAD 방식 로컬 AI 성능...
• 이거하려고 NVIDIA 50 시리즈 모두 모았다... 로컬 AI성능 전수 테...
• 5090 가격의 ⅓인데 로컬 AI 성능은? R9700 (VRAM 32GB) ...
• RTX 5090, R9700 부터 혼종 듀얼 GPU까지, 그래픽카드 16종 ...
• GPU 성능을 최대로 활용하는 llama.cpp 완전 가이드 | 설치·KV캐...
• 좀 더 똑똑 해지는 로컬 AI 설정법!! 웹 검색 MCP 서버 연동 가이드 ...
• 말 한마디에 게임이 만들어지는 시대! 로컬 AI도 된다? 에이전트 기능 활용...
• 토큰비용 0원? 유료 구독 없이 로컬 AI로만 바이브 코딩 어디까지 가능할까...
• 로컬 AI 구축 최대의 적, 무한루프 결국 이렇게 해결했습니다 (Local ...
• 로컬 AI 환경에서 Hermes Agent 응답 속도 '강제 소생' 하는 최...
• AI 에이전트 + 통합개발환경(IDE) MCP Server 연동 / 툴콜링 ...
• 메타(META)의 30B 오픈웨이트 신모델 쓸만할까? 6시간동안 직접 돌려본...
• 엔비디아가 새로 출시한 로컬 LLM 모델 컨텍스트가 무려 100만? 성능은?...
• 고작 27B로 이정도나 된다고? 로컬 AI, 이 모델 빼고 다 지웠습니다 /...
• 성능은 좋은데 답변이 느리다? Qwen 3.8 27B 속도 개선 총정리
• 5090 가격의 ⅓ 인텔 GPU도 로컬AI 가능? B70 (VRAM 32GB...
• [Local AI News] 신규 맥스튜디오 출시, Qwen 3.8 Flas...
• 1629만원짜리 1.2TB/s 메모리 대역폭의 Mac Studio 구매 준비...
• 인텔 B70 GPU 3장 꽂아서 VULKAN으로 Qwen 3.8 FLASH ...
• RTX 5090 + 인텔 ARC B70 성능 다른 혼종 구성?! 2 GPU ...
• Qwen 3.8 27B Q6 CUDA 가능한 가성비 끝판왕 세팅으로 LLM ...
━━━━━━━━━━━━━━━
⏱️ 타임라인 (Timeline)
━━━━━━━━━━━━━━━
00:00 인트로 - 오늘의 주제 소개
00:10 Qwen 3.8 27B VRAM 요구량 분석
01:49 LM Studio 양자화별 모델 파일 크기 비교
03:44 RTX 3090 단독 구성 Q4_0 양자화 모델 TPS 테스트
04:20 RTX 3090 메모리 대역폭 비교 (40/50시리즈 대비)
05:28 Q4_0 양자화 모델 MTP 적용 TPS 테스트 (N-MAX 2 vs 3)
06:17 Q4_0 양자화 모델 컨텍스트 사이즈 한계 테스트
09:37 NVFP4 MTP 모델 테스트
10:22 오늘의 본론
11:12 Q6 양자화 모델 구동 방안 모색
12:17 3080Ti / 3080 12GB 조합 아이디어
13:55 RTX 3080 12GB 추가 장착, VRAM 36GB 구성 완성
15:13 Q6_K 양자화 모델 TPS 테스트(MTP 포함)
17:06 Q6_K 양자화 모델 컨텍스트 사이즈 테스트
18:16 8비트 양자화 모델 TPS 테스트
20:29 LLM서버 + 헤르메스 에이전트 + 텔레그램 연동 + 개발 작업 준비
22:13 LLM 런처 개선 작업 착수 - 프로그램 분석 문서화 지시
28:05 수정 작업 기획 + 유지보수 계획서 작성 및 검토
41:56 단계 별 개발 진행 및 완료 보고
44:41 유지보수 완료 보고서 작성 및 전달
46:18 LLM 런처 1.3 버전 테스트
48:16 추가 UI 수정 지시 및 최종 확인
51:34 총평 - 200만 원대로 CUDA VRAM 36GB 구성
52:52 중요 포인트
━━━━━━━━━━━━━━━━━━━━━━━
#Qwen3 #로컬LLM #RTX3090 #RTX3080 #llamacpp #헤르메스에이전트 #가성비GPU #바이브코딩 #LLM런처
━━━━━━━━━━━━━━━━━━━━━━━
[멤버쉽 혜택 안내]
영상 공개 작업 완료 전 영상이 전체 공개일정보다 빠른 시간에 회원 전용으로 미리 업로드 될 수 있으며 멤버쉽 회원은 이러한 영상을 미리 시청하실 수 있습니다.
/ @s0ul_seeker
[댓글 질문 가이드]
유튜브 채널 관리 프로그램의 댓글확인 인터페이스에 따라
"댓글이 달리지 않은 글"을 모아 볼 수 있는데 이 때 "대댓글"은 포함되지 않습니다.
중요한 내용은 "대댓글" 말고 "새 댓글"로 작성해 주셔야 빠른 확인이 가능합니다.
답변 받으신분들은 좋아요 한번씩..