전체 글 34

DGX Spark로 OpenClaw Local LLM 구성- GPT-OSS-120B 최적화하기

DGX Spark에서 GPT-OSS 최적화하기NVIDIA DGX Spark (GB10, SM 12.1, 128GB 통합 메모리) 환경에서vLLM + openai/gpt-oss-120b의 추론 성능을 단계별로 최적화한 기록1. 테스트 환경항목사양하드웨어NVIDIA DGX Spark (GB10 SoC)GPU 아키텍처Blackwell SM 12.1 (consumer/edge)메모리128GB 통합 메모리 (CPU+GPU 공유), 273 GB/sOSLinux 6.17.0-1008-nvidia (aarch64)모델openai/gpt-oss-120b (120B MoE, MXFP4)추론 엔진vLLM (NGC 이미지: nvcr.io/nvidia/vllm:26.01-py3)배포 방식Docker Compose2. Basel..

AI/LLM 2026.02.25

DGX Spark로 OpenClaw Local LLM 구성 — Provider 선정기

DGX Spark로 OpenClaw Local LLM 구성 — Provider 선정기 핫한 OpenClaw로 이것저것 시도해보던중 유료 LLM의 탁월한 성능과 함께 개발단계부터 비용적 한계를 느꼈다. 그래서 하이브리드 구성(전략: 유료 LLM 연산/실행: Local LLM) 을 위해 먼저 local LLM Provider로 Ollama, SGLang, vLLM 세 가지를 DGX Spark에서 테스트했다. GPT-OSS-120B 모델 기준으로 DGX Spark에서 테스트해보고 내린 결론은 개인 사용이면 Ollama(41 tok/s), 팀 공유 서버면 vLLM(35.3 tok/s)이다. SGLang은 DGX Spark의 GPU(SM 12.1)가 데이터센터 Blackwell(SM 100)과 다른 명령어 ..

AI/LLM 2026.02.25

seedance 2.0 사용해보기

seedance 2.0 이 요즘 핫하다. 중국 AI 공부도 하고, 중국어 복습도 해볼겸. 가끔 글을 올려야겠다. bytedance 산하의 AI플랫폼 jimeng AI ( https://jimeng.jianying.com/ ) 에서 해당 모델을 테스트해 볼 수 있다. 1. 홈페이지 메뉴 설명 文生图 : wenshengtu -> Text to Image视频生成: shipin shengcheng -> 영상 생성智能画布: zhineng huabu -> smart canvas探索: tansuo -> 다른 유저들의 작품 및 프롬프트 참고未来影像计划: weilai yingxiang jihua -> 미래 비전등을 볼수있는 페이지 开启即梦 : kaiqi jimeng -> 회원가입. 직역하면 즉각적인 꿈만들기 (jim..

AI/중국AI산책 2026.02.16

local llm: Open WebUI를 tailscale로 외부에서 접속하기

🚀 내 책상 위 AI 슈퍼컴퓨터, 외부에서 안전하게 접속하기 (Open WebUI + Tailscale)집에서 local llm을 만들고 open webui로 사용해보는데, 집 밖에서도 사용해야할 경우가 있다.하지만 공유기 포트 포워딩은 보안상 찝찝하고 설정도 귀찮다. 이럴 때 가장 깔끔한 정답은 Tailscale이다. 복잡한 VPN 설정 없이 내 기기들을 하나의 가상 네트워크로 묶고, 심지어 HTTPS 도메인까지 공짜로 입히는 법을 알아보자.1. Tailscale 설치 및 연동먼저 고속도로부터 깔아야 한다. 접속할 llm및 open webui 호스트서버와 클라이언트(노트북) 양쪽 모두에 Tailscale을 설치하자.llm host 서버에서:curl -fsSL https://pkgs.tailscale...

AI/LLM 2026.02.16

PDF Table 처리 비교

EURO Regulations관련 Annex table을 LLM에서 가장 잘이해하고 처리할 수있는 형태로 chungking하고자했다.LLM은 일반적으로 Markdown에 더 높은 성능과 안정성을 보인다.pdf table -> markdown 전환시 완성도 우수pdf table -> markdown direct 변환(pandas 등 중간 layer x)무료 > 유료라는 조건으로 llamaparse(llamaindex), pymupdf4llm 등 RAG특화 툴과 비교적 classic한 pdfplumber, camelot+pandas 조합을 테스트해봤다. 원본 pdf파일1. llamaparsellamaindex의 명성에 비해,, 생각보다 실망스러웠다.# Step 1: LlamaParse로 PDF를 Markd..

AI/RAG 2026.01.16

NVIDIA vGPU GPU Operator install

대부분의 내용은 gpu operator 페이지에 다있다.https://docs.nvidia.com/datacenter/cloud-native/gpu-operator/ https://docs.nvidia.com/datacenter/cloud-native/gpu-operator/ docs.nvidia.com  1.vGPU드라이버 다운로드vGPU드라이버는 유료라이센스. 전용페이지에서 다운 2.준비물driver(.run) 파일vGPUDriverCatalog.yamlgridd.conf.tok파일 3.환경변수설정 4.driver 이미지 빌드준비물포함 5.configmap 생성 - licensing-config vGPU 라이센스- metrics-configDCGM exporter의 커스텀 메트릭 사용을 위한 csv파..

MLOps/GPU 2024.06.16

gpu operator helm 주요 파라미터

# redhat openshift 여부platform:   openshift: false  # node feature discovery 사용여부. node의 정보(cpu, gpu, mem등)을 수집nfd:   enabled: true   nodefeaturerules: false  # pod security admission 사용여부psa:   enabled: false  # containder device interface 사용여부/ true로 하면 default runtime class(nvidia)외에  2개의 runtime class(nvidia-cdi, nvidia-legacy)를 모두 사용가능# cri에서 nvidia gpu같은 복잡한 device를 활용하는데 있어서 표준 스펙을 만듬.cdi:..

MLOps/GPU 2024.06.16

NVIDIA GPU Operator 용어

GPU Driver CRD (NVIDIA Driver CRD)개별 노드에 GPU driver type과 버전을 지정할 수 있는 nvidia custom driver, custom resource를 생성할 수 있다.노드셀렉터를 통해 노드별 os에 따른 드라이버설정 가능-- Cluster Policy CRD와 NVIDIA Driver CRD 비교https://docs.nvidia.com/datacenter/cloud-native/gpu-operator/latest/gpu-driver-configuration.htmlKubeVirtk8s cluster상 VM환경 생성성하고 관리하게 해주는 기술.VM과 Container를 위한 개별 클러스터를 구성할 필요 없이 하나의 k8s cluster에서 모두 사용가능하게 ..

MLOps/GPU 2024.06.16

GPUDirect RDMA와 vGPU

먼저 RDMA부터 알아보자RDMA (Remote Direct Memory Access)RDMA는 네트워크를 통해 데이터 전송 시, CPU의 개입을 최소화하고 메모리 대 메모리 전송을 직접 수행하는 기술입니다. 주요 특징은 다음과 같습니다:낮은 지연 시간: 데이터 전송 중에 CPU가 관여하지 않기 때문에 지연 시간이 매우 짧습니다.높은 대역폭: 네트워크 인터페이스 카드(NIC)가 직접 메모리에 접근하여 데이터를 전송하기 때문에 높은 대역폭을 제공합니다.낮은 CPU 오버헤드: CPU의 개입이 최소화되어 CPU 사용률이 낮아집니다.제로 카피: 데이터가 직접 전송되므로 추가적인 데이터 복사가 필요 없습니다.RDMA는 인피니밴드(InfiniBand), RoCE (RDMA over Converged Ethernet..

MLOps/GPU 2024.06.11

keydb

1. keydb vs redis기본적으로 keydb는 redis에서 fork되어 개선하고자 탄생했다.특히 keydb는 기존 redis에서 더 발전한 HA구성이 돋보인다.기존 reids처럼 master-slave 구성도 지원하지만,Active-Replica와 Multi-Master 이 두가지 특성이 Redis보다 발전된 load balancing 기능을 지원한다.이 경우 keydb에서 sentinel을 사용할 필요가 없어진다.(redis-sentinel-HA proxy 더이상 안써도되나!!!)Active-Replica:Active-Replica 모드는 하나의 마스터 노드와 여러 Replica노드를 허용하는 Redis의 일반적인 Master-Slave replica 모델을 개선한 것이다.Active-Repl..