5개 hidden layer를 조건으로 DSpark를 500K post-training하고 472.8 tok/s까지 측정한 과정.
장문 Prefill이 Decode를 멈추던 원인을 추적하고, 역할 분리와 KV Cache 전송으로 ITL p95를 2,873ms에서 29.2ms로 줄인 과정.
MTEB 한국어·일본어 리트리벌 벤치마크 1위 임베딩 모델의 학습 데이터 구성부터 하드 네거티브 마이닝 전략까지.
GLM-5.2 753B 모델을 SASS 수준에서 최적화해서 초당 600~1000 토큰 생성하는 법.
DGX B300의 ConnectX-8 800G 포트 8개를 활용해 네트워크 장비 없이 소규모 클러스터를 구성합니다.
AI가 생성한 코드가 컨테이너 내부에서 실행될 때, 우리는 어디까지 불안해해야 하고 무엇을 막아야 할까요?
270개 질문 벤치마크에서 STORM Parse가 20%p 이상 높은 정확도를 보인 이유와 VLM 기반 문서 파싱의 영향.