본문으로 건너뛰기
← 뉴스레터 목록

Issue #51 · 2026-07-26 · 2026. 7. 26.

vibecamp ai builder 2026-07-26 — vLLM v0.26.0 — Inkling 당일 지원, DeepSeek-V

2026-07-26 AI 빌더 일간 호 — 오늘 10개 카드를 정리했습니다.

📤 공유하기𝕏@inf💬B
🛠

최신 기술 트렌드

vLLM v0.26.0 릴리스 노트 GitHub 카드 — 'New Release v0.26.0' 제목과 '411 commits from 212 contributors (61 new)' 하이라이트 문구, 우측에 vLLM 로고

vLLM v0.26.0 — Inkling 당일 지원, DeepSeek-V4 가속

LLM 서빙 엔진 vLLM이 7/25 v0.26.0을 냈습니다. 릴리스 노트 기준 411개 커밋에 기여자 212명(그중 신규 61명)이 참여했습니다. 신규 Inkling 모델 패밀리를 기본 모델링부터 CUDA graph, Hopper FA4 어텐션, speculative decoding, LoRA, NVFP4 양자화까지 한 번에 지원합니다. DeepSeek-V4에는 전용 라우팅 커널로 종단 TPOT(토큰당 지연) 2.94% 개선, fused_topk_bias 커널 1.5~2배 가속, 중복 복사 제거로 1.8% 개선이 붙었습니다. 어텐션 백엔드를 KV 캐시 그룹별로 골라 쓸 수 있고, 슬라이딩 윈도우 지원이 백엔드 능력으로 명시됐습니다. 수치는 모두 릴리스 노트 자체 측정치입니다.
💡자체 GPU에 모델을 올려 서빙 중이라면 코드 수정 없이 버전만 올려도 지연과 KV 캐시 여유를 얻습니다. 같은 하드웨어로 더 긴 컨텍스트와 더 많은 동시 요청을 받을 수 있는지 다시 재볼 시점입니다.
누가
vLLM 오픈소스 프로젝트 (이번 릴리스에 212명 기여, 그중 61명이 신규 기여자)
무엇을
LLM 서빙 엔진 vLLM v0.26.0 릴리스 — 신규 Inkling 모델 패밀리 전체 지원 스택(모델링·CUDA graph·FA4 어텐션·speculative decoding·LoRA·NVFP4 양자화), DeepSeek-V4 전용 라우팅 커널 등 성능 최적화, KV 캐시 그룹별 어텐션 백엔드 선택, KV 오프로딩·2차 스토리지 계층화
언제
2026-07-25T10:38:53Z
새로 나온 모델(Inkling·DeepSeek-V4)을 별도 포크 없이 프로덕션 서빙에 바로 올리고, MoE·긴 컨텍스트 추론에서 반복 발생하던 메모리·지연 병목(중복 copy, 고정 어텐션 백엔드, KV 캐시 용량)을 릴리스 레벨에서 걷어내기 위해
#vllm#inference#deepseek-v4#serving#open-source
이미지: AI 생성 이미지원문 →
Ollama v0.32.4 릴리스 노트 GitHub 카드 — Apple GPU MLX 엔진 Laguna 지원과 Qwen3 MoE 디코딩 수정이 담긴 변경 사항 요약

Ollama v0.32.4 — 애플 GPU Laguna 지원, Qwen3 MoE 수정

로컬 LLM 실행 도구 Ollama가 7/25 v0.32.4를 냈습니다. MLX 엔진 경로가 붙어 애플 GPU에서 Laguna 모델을 별도 빌드 없이 돌릴 수 있습니다. speculative decoding용 드래프트 모델을 만들 때 출력 헤드를 요청한 양자화 타입으로 맞추도록 바뀌었고, 전문가마다 양자화가 다른 Qwen3 MoE에서 잘못된 디코딩이 나오던 버그를 잡았습니다. 묶인 gate/up 프로젝션도 빨라져 M5 Max 기준 약 4~9% 개선이라고 릴리스 노트에 적혀 있습니다. 속도 수치는 팀 자체 측정치로 독립 벤치마크는 없습니다.
💡맥북으로 로컬 추론을 돌린다면 업데이트만으로 MoE 출력 정확도와 속도가 같이 올라갑니다. 로컬 모델을 비교 평가 중이었다면 기존 측정치는 버전을 올린 뒤 다시 재는 편이 맞습니다.
누가
Ollama 팀 (ollama/ollama 메인테이너)
무엇을
로컬 LLM 실행 도구 Ollama v0.32.4 릴리스 — MLX 엔진 경로로 Apple GPU에서 Laguna 모델 지원, speculative decoding 드래프트 생성 시 output head를 요청한 타입으로 양자화, 전문가별 양자화가 다른 Qwen3 MoE 디코딩 버그 수정 및 packed gate/up projection 가속(M5 Max 기준 약 4~9%)
언제
2026-07-25T02:22:12Z
맥에서 로컬 추론을 돌리는 사용자가 신규 모델을 별도 빌드 없이 바로 쓰게 하고, 전문가마다 양자화 타입이 다른 MoE 모델에서 발생하던 잘못된 디코딩과 속도 손실을 제거하기 위해
#ollama#local-llm#apple-silicon#mlx#quantization
이미지: AI 생성 이미지원문 →
🏆

해커톤·대회

OpenArena.to 공식 이벤트 카드 — 'BUIDL_OPC_HZ_0725' 대회명과 OPEN ARENA · OFFICIAL EVENT 표기, 시작 7월 20일 / 종료 7월 25일 일정

2시간 해커스프린트 항저우 — 1인 기업을 에이전트로 굴려라

amber.ac·DN Hangzhou·KeyMap DAO가 7/25 중국 항저우에서 연 BUIDL_OPC Hackasprint가 당일 시상까지 마쳤습니다. 주제는 '에이전틱 서비스로 차세대 1인 기업 만들기', 약 200명이 현장에서 단 2시간 안에 만들어 데모했습니다. 심사 기준 다섯 개가 특이합니다 — 실제 경험에 기반했는가, 문제 해결 논리가 서는가, AI가 낸 임팩트가 진짜인가, 애초에 AI가 꼭 필요한 문제인가, 자율 운영이 되는가. 수상은 심사위원 선정 9팀에 공개 투표 1팀을 더해 10팀이고, 챔피언에게는 MacBook Pro M5 한 대(16GB RAM·1TB), 상위 10개 프로젝트에는 각 $100 토큰 크레딧이 갑니다. 다만 수상팀과 수상작 명단은 아직 공식 페이지에 공개되지 않았습니다.
💡상금보다 심사표가 자산입니다. '경험 기반 → AI 필요성 검증 → 자율 운영' 순서를 자기 사이드 프로젝트 점검표로 그대로 쓸 수 있습니다. 2시간 안에 넘길 수 있는 일 한 조각부터 골라 보세요.
누가
amber.ac · DN Hangzhou · KeyMap DAO 공동 주최, 중국 항저우 후이진윈촹 6동 501호 오프라인. 약 200명 규모 빌더 참가. 수상은 심사위원 선정 9팀 + 공개 투표 1팀, 총 10팀 (챔피언 1팀 포함). 우승팀 명단은 현장 시상으로 확정됐으나 아직 미공개
무엇을
'차세대 1인 기업(One Person Company)을 에이전틱 서비스로 만든다'를 주제로 한 초단기 해커스프린트. 참가자는 단 2시간 안에 자기 업(業)의 전문성을 AI 에이전트로 증폭시키는 제품을 만들어 데모해야 한다
언제
2026-07-25(토) 13:00~18:10 CST(GMT+8) 현장 개최 — 2시간 빌드 스프린트 후 당일 심사·시상 종료 (한국시각 7월 25일 14:00~19:10). 종료·시상일이 발행 호(2026-07-26) 기준 24시간 이내
심사 기준 5개가 특이하다 — (1) 실제 경험에 기반했는가, (2) 문제 해결 논리가 성립하는가, (3) AI가 만든 임팩트가 진짜인가, (4) 애초에 AI가 꼭 필요한 문제인가, (5) 자율 운영(autonomous operation)이 되는가. 특히 (4)번 'AI 통합의 필요성'을 독립 채점축으로 세워, AI를 붙이지 않아도 되는 문제에 억지로 붙인 데모를 걸러내겠다는 의도가 분명하다
#hackathon#one-person-company#agentic-service#judging-criteria#hangzhou
이미지: AI 생성 이미지원문 →
HackXperience 2026 공식 히어로 이미지 — 검은 배경 위에 점과 회로선으로 구성된 옆얼굴 실루엣 일러스트, 붉은 프레임 장식

싱가포르 HackXperience — 24시간 안에 배포까지 강제한 해커톤

싱가포르 SIM IT Club이 7/24~25 캠퍼스에서 연 플래그십 해커톤 HackXperience 2026이 25일 폐회식으로 끝났습니다. 주제는 'AI for Living', 일과 삶 사이의 마찰을 에이전틱 AI로 줄이는 제품입니다. 3~4인 팀으로 학생 빌더 100명 이상이 참가했고, 정신건강·운동·식단을 다루는 Care Forward와 업무 관리·워크플로 자동화를 다루는 Friction To Flow 두 트랙에 거의 반반씩 몰렸습니다. 요구사항이 프로토타입이 아니라 '만들고 배포하기'여서 24시간 안에 실제 배포까지 끝내야 했습니다. 상금은 싱가포르달러로 총 1,800 규모 — 트랙 우승 각 300, 준우승 각 150인데 Best Microsoft Stack 특별상이 700으로 가장 큽니다. 수상팀 명단은 아직 공개되지 않았습니다.
💡24시간 배포 강제, 커뮤니티 투표상, 스폰서 스택 특별상 세 가지는 사내 해커톤 설계에 그대로 복제할 수 있습니다. 개인용 에이전트 아이디어를 고를 때도 '케어'와 '마찰 제거' 두 갈래가 쓸 만한 프레임입니다.
누가
싱가포르 SIM IT Club 주관 플래그십 해커톤, 후원 DynamicWeb·IAMCP·SIM Student Life. 3~4인 팀 기준 100명 이상 학생 빌더 참가. 수상 카테고리는 트랙 우승/준우승 외에 Best Microsoft Stack·Best Entrepreneurial·Community Choice로 나뉘며, 개별 수상팀 명단은 시상 직후 아직 공개 전
무엇을
'AI for Living' — 일과 삶 사이의 마찰을 에이전틱 AI로 줄이는 제품을 24시간 안에 만들어 실제로 배포까지 하는 스프린트. 트랙은 둘로, 정신건강·운동·식단을 다루는 'Care Forward'와 업무 관리·업무 품질·워크플로 자동화를 다루는 'Friction To Flow'
언제
2026-07-24(금)~07-25(토) SIM 캠퍼스 개최 — 25일 12:00 제출 마감 → 13:00~15:30 피칭 → 17:30~18:00 폐회·시상식(SGT). 한국시각 7월 25일 18:30~19:00 시상 종료로, 발행 호(2026-07-26) 기준 24시간 이내
요구사항이 '프로토타입'이 아니라 '빌드 앤 디플로이(build and deploy)'다. 24시간 안에 배포까지 끝내야 하므로, 모델을 얼마나 잘 쓰느냐보다 에이전트를 실제 사용자 손에 올려놓는 배포·운영 역량이 사실상 채점된다. 상금 구성에서 Best Microsoft Stack이 S$700로 트랙 우승(S$300)보다 큰 것도 특징 — 스폰서 스택 채택을 상금 구조로 유도한 전형
#hackathon#agentic-ai#singapore#deploy-first#wellbeing
이미지: AI 생성 이미지원문 →
💰

매출·사례

SK하이닉스 뉴스룸 보도자료 대표 이미지 — 짙은 녹색 배경에 SK hynix와 NVIDIA 로고가 얹힌 반도체 칩 그래픽, 좌측에 PRESS RELEASE 문구

엔비디아·SK $500B 파트너십 — 네이버엔 $1B 직접 투자

엔비디아와 SK그룹이 7/25 $500B 이상 규모의 장기 파트너십 의향서를 공개했습니다. 엔비디아는 SK하이닉스의 HBM4 등 차세대 AI 메모리를 장기 확보·공동개발하고, SK텔레콤은 국내에 2GW 이상 규모의 Vera Rubin DSX AI 팩토리를 짓습니다. 첫 가동은 2027년입니다. 별건으로 엔비디아는 네이버에 $1B를 직접 투자해 네이버 AI 데이터센터를 55MW→200MW로 키우고, 브룩필드가 최대 $9B 프로젝트 파이낸싱 텀시트(논바인딩)를 냈습니다. $500B는 양측 상호 거래를 합산한 장기 규모이며, 현 단계가 의향서라 회계상 확정된 매출은 아닙니다.
💡AI 사이클에서 가장 확실한 매출은 모델이 아니라 병목 자원을 쥔 쪽에서 납니다. 내 제품이 어떤 병목 위에 서 있는지, 연 단위 사용량 선확정을 자금 조달 근거로 쓸 수 있는지 점검해 보세요.
누가
SK그룹(최태원 회장) — SK하이닉스(AI 메모리·HBM4, 임직원 약 3.2만 명)와 SK텔레콤(AI 데이터센터) 축. 상대는 엔비디아(젠슨 황 CEO). 별건으로 네이버가 엔비디아로부터 10억 달러 직접 투자 유치.
무엇을
엔비디아와 SK그룹이 5,000억 달러 이상 규모의 장기 상호 거래 파트너십 LOI 체결. 엔비디아는 SK하이닉스 HBM4 등 차세대 AI 메모리를 장기 확보·공동설계하고, SK텔레콤은 2GW 이상 규모의 'Vera Rubin DSX AI 팩토리'를 국내에 구축한다. 동시에 엔비디아는 네이버에 10억 달러를 투자해 네이버 AI 데이터센터를 55MW → 200MW로 3.6배 확장하며, 브룩필드가 최대 90억 달러 프로젝트 파이낸싱 의향을 밝혔다.
언제
2026-07-25 발표 (CNBC 05:00 UTC, SK하이닉스 뉴스룸/GlobeNewswire 보도자료 동일자, Bloomberg 2026-07-24 미국 저녁). 이재명 대통령 실리콘밸리 방문 일정에 맞춰 공개, 첫 AI 팩토리 가동은 2027년.
엔비디아 입장에서 병목은 이제 GPU 다이가 아니라 HBM 메모리 물량과 전력·부지다. 장기 구매 약정으로 메모리 공급을 선점하고, 한국을 아시아·태평양 수요를 받아내는 '소버린 AI' 생산기지로 묶으려는 계산. SK 입장에서는 HBM 재고 리스크 없이 수년치 수요를 미리 확정하고, 메모리 판매사에서 AI 인프라 운영사로 사업 구조를 옮기는 계기다.
#nvidia#sk-hynix#hbm4#ai-datacenter#sovereign-ai
이미지: AI 생성 이미지원문 →
2026년 7월 24일 샌프란시스코 AI 서밋 현장 사진 — 파란 배경 무대에서 계약 서류를 든 삼성전자·브로드컴 관계자와 참석 인사들이 나란히 선 모습

삼성·브로드컴 $200B 5년 계약 — 메모리·파운드리·패키징 턴키

삼성전자가 7/24 샌프란시스코 AI 서밋에서 브로드컴과 $200B(약 292조원) 규모 5년 공급 계약을 맺었고 7/25 공개됐습니다. 2030년까지 브로드컴 AI 가속기용 HBM4·HBM4E를 공급하고, 브로드컴 데이터통신 칩을 2나노 파운드리로 위탁 생산하며, 첨단 패키징까지 한 묶음으로 제공하는 턴키 계약입니다. 전영현 부회장은 AI 시대에는 메모리·로직·첨단 패키징을 촘촘히 통합한 반도체 솔루션이 무엇보다 중요하다고 밝혔습니다. 세 가지를 모두 자체 소화하는 곳이 삼성뿐이라 통합 리스크를 한 곳에 몰아준 구조입니다. 삼성은 2026년 2월 HBM4 양산을 시작했고 5월 HBM4E 첫 샘플을 냈습니다. 연도별 물량 배분은 비공개입니다.
💡경쟁자가 더 잘하는 단일 기능에서 붙지 말고, 나만 한 번에 묶을 수 있는 조합을 계약 단위로 재정의하는 쪽이 이깁니다. HBM4 양산에서 계약까지 173일 — 병목 기술은 완성 직후가 가장 비쌉니다.
누가
삼성전자 DS부문(전영현 부회장, 반도체 부문 임직원 약 7만 명 규모)과 브로드컴. 이재명 대통령 실리콘밸리 방문 일정과 같은 주간에 성사.
무엇을
브로드컴이 삼성전자에 2,000억 달러(약 292조 원) 규모 5년 공급을 발주. 내용은 ① 브로드컴 AI 가속기용 HBM4·HBM4E 메모리 공급, ② 브로드컴 데이터통신 칩의 2나노 이하 파운드리 위탁 생산, ③ 첨단 패키징까지 한 묶음으로 제공하는 '턴키' 계약이다.
언제
2026-07-24 샌프란시스코 AI 서밋에서 계약 체결, 2026-07-25 공개 (Bloomberg / 서울경제 05:54 UTC, 14:54 KST). 계약 기간은 2030년까지 5년.
구글 TPU 등 커스텀 AI 가속기를 설계하는 브로드컴은 메모리(HBM)·로직(파운드리)·패키징을 각각 다른 업체에 붙이면 일정과 수율이 흔들린다. 세 가지를 자체적으로 다 하는 곳은 전 세계에서 삼성뿐이라, 통합 리스크를 줄이려고 한 곳에 몰아준 것. 삼성 입장에서는 TSMC에 밀리던 파운드리를 '메모리를 끼워 파는 방식'으로 되살린 셈이다.
#samsung#broadcom#hbm4#foundry#turnkey
이미지: AI 생성 이미지원문 →
🎙

기술+사람 인터뷰

20VC 에피소드 공식 아트워크 — Mercor 최고제품책임자 오스발드 니츠키의 인물 사진 위에 MERCOR 로고와 THE 20VC SHOW 표기

20VC — Mercor CPO와 매출 편중·소형 특화 모델 61분 대담

20VC가 7/25 Mercor 최고제품책임자 오스발드 니츠키와 나눈 61분 대담을 공개했습니다. Mercor는 프론티어 모델 학습을 떠받치는 전문가 데이터 마켓플레이스로, 20VC 쇼노트 기준 6월에 ARR $1B→$2B를 4개월 만에 넘겼고 시리즈C $350M을 밸류 $10B에 받았습니다(독립 확인 전 수치입니다). 아젠다는 오픈소스 모델이 데이터 공급자 사업을 잠식하는지, 대기업이 프론티어 랩과의 직접 제휴를 왜 꺼리는지, 회사마다 자사 특화 소형 모델을 갖게 되는지, 창업자가 성능과 폭증하는 토큰 비용을 어떻게 저울질할지, AI 네이티브 시대의 PM은 무엇이 다른지로 이어집니다. 37분 구간에서는 소수 프론티어 랩 고객에 매출이 몰린 문제를 정면으로 다룹니다.
💡성장률로 매출 집중도를 덮지 마세요. 상위 고객 의존도를 성장 지표와 분리해 따로 추적하고, 모델 성능과 토큰 비용은 감이 아니라 명시적 예산으로 관리하는 것이 이 회차의 멘탈 모델입니다.
누가
인터뷰이: Osvald Nitski, Mercor 최고제품책임자(CPO) — Mercor는 프론티어 모델 학습을 떠받치는 AI 학습·전문가 데이터 마켓플레이스 / 인터뷰어: Harry Stebbings, 20VC(The Twenty Minute VC) 진행자
무엇을
오픈소스 모델 확산 속 데이터 공급자 사업의 생존, 대기업이 프론티어 랩과의 직접 제휴를 꺼리는 이유, 회사마다 소형 특화 모델을 갖게 되는 미래, 그리고 AI 네이티브 시대 PM·제품팀의 일하는 방식을 60분간 다룬 대담
언제
2026-07-25 07:07 UTC(한국시간 16:07) 20VC 공개 — 61분 분량 풀 에피소드
Kimi K3 등 중국발 오픈 모델과 프론티어 랩 가격 인하가 동시에 터진 2026년 7월, '데이터·평가 공급자 사업이 오픈소스에 잠식되는가'는 지금 가장 뜨거운 질문이다. Mercor는 4개월 만에 ARR $1B→$2B로 두 배가 됐지만 매출이 소수 프론티어 랩에 집중돼 있다는 지적을 받아왔고, 이번 회차에서 CPO가 그 집중 리스크와 대응 전략을 정면으로 답한다. 초고속 성장과 고객 편중을 동시에 안은 회사가 어떻게 판단하는지 실시간으로 볼 수 있는 자료.
#20vc#mercor#product-management#revenue-concentration#small-models
이미지: AI 생성 이미지원문 →

이 호가 도움됐다면 공유해 주세요.

📤 공유하기𝕏@inf💬B