AI INFRASTRUCTURE CHECK

보유한 GPU 서버,
어떤 AI를 실행할 수 있을까요?

GPU와 메모리 사양으로 모델 후보와 증설 방향을 살펴보세요.

AI 인프라 진단

입력한 사양은 서버에 전송하거나 저장하지 않습니다. 계산은 브라우저에서만 수행합니다.

서버 사양

모델명은 사양 입력을 돕는 예시입니다. GPU별 연산 속도·지원 여부는 판정하지 않습니다.

등록 사용자 수가 아닌, 같은 시점에 응답을 생성하는 세션 수입니다.

같은 사양의 전용 GPU를 가정합니다. 분산 실행은 엔진·연결·텐서 병렬 호환성 검증이 필요하며 VRAM이 자동으로 합쳐지지는 않습니다.

YOUR AI ENVIRONMENT

사양을 입력하면
모델별 가능 범위를 보여드립니다.

Qwen3.8 · Qwen3.6 · Qwen3.5
27B · 35B-A3B · 9B · 4B 비교
양자화 · 메모리 기준 세션 · 증설 방향

기본 입력값은 A40 48GB 1장, RAM 128GB입니다.

계산 기준과 한계 보기 · 규칙 v2.1 · 2026.09.19

GPU 표기 용량을 GiB로 근사하며 총량의 20%를 여유 공간으로, GPU당 2GiB를 실행 오버헤드로 남깁니다. 가중치는 파라미터 수 × 비트/8 × 1.15, 세션 메모리는 모델별 공식 config의 전체 어텐션 레이어·KV 헤드·차원을 적용한 16bit KV 캐시와 FP32 순환·합성곱 상태, 0.5GiB 여유분을 더합니다. 각 BF16 체크포인트 크기로 비전·MTP 가중치까지 포함하되 텍스트 추론만 계산합니다. 실행 엔진의 상태 할당·접두사 캐시 방식에 따라 실제 사용량이 달라집니다. 시스템 RAM은 기본 16GiB, 가중치 사본 및 세션당 2GiB를 가정하며 교육·RAG에는 8GiB를 추가합니다. 이는 배포 계획용 가정이며 실측값이 아닙니다.

목표 세션을 수용하는 가장 높은 정밀도(BF16/FP16 → 8bit → 4bit)를 우선 제시합니다. 양자화 파일·런타임 지원과 품질은 별도 확인이 필요합니다. 학습·파인튜닝, 이미지·음성 모델, GPU 공유·vGPU, 혼합 GPU, CPU 오프로딩, 디스크·네트워크·초당 토큰 수는 계산하지 않습니다. GPU가 없으면 실행 판정을 보류합니다.

비교 모델 출처: Qwen3.8-27B · Qwen3.6-27B · Qwen3.6-35B-A3B · Qwen3.5-9B · Qwen3.5-4B
모델 구조 출처: Qwen3.8-27B 공식 모델 · 구조 설정 · 가중치 인덱스. Qwen3.8과 이전 세대의 소형·MoE 모델을 비교합니다. MoE는 활성 파라미터가 아닌 전체 가중치 적재 기준이며, API 전용 모델과 벤치마크 성능은 계산하지 않습니다. 제품 라이선스와 사용 조건도 도입 전에 확인합니다. llmfit의 하드웨어 적합성 진단 아이디어를 참고한 독립 계산기이며, 현재 llmfit API는 연결하지 않습니다.