본문으로 건너뛰기
← 뉴스레터 목록

Issue #68 · 2026-08-26 · 2026. 8. 26.

vibecamp ai builder 2026-08-26 — llama.cpp v0.3.0, 옵션 하나로 GPU 텐서 병렬

2026-08-26 AI 빌더 일간 호 — 오늘 11개 카드를 정리했습니다.

📤 공유하기𝕏@inf💬B
🛠

최신 기술 트렌드

llama.cpp v0.3.0 릴리스의 GitHub 오픈그래프 카드. ggml-org/llama.cpp 저장소 이름과 기여자·이슈·스타·포크 수가 함께 표시돼 있다.

llama.cpp v0.3.0, 옵션 하나로 GPU 텐서 병렬

ggml-org가 llama.cpp v0.3.0을 8월 25일 정식 릴리스했다. 눈에 띄는 건 -sm tensor 옵션 하나로 DeepSeek 4를 여러 GPU에 텐서 병렬로 쪼개 돌릴 수 있게 된 점이다. 함께 다중 시퀀스 롤백 버그와 meta 백엔드의 텐서 분할 상태 전파 오류도 잡혔다. 멀티모달 쪽은 신규 DSA-ISWA KV 캐시를 쓰는 dots3-note 모델을 지원하고, mtmd가 WebP 디코딩과 Pillow와 동일한 리사이즈를 구현했다 — 파이썬 전처리 파이프라인과 결과가 미묘하게 어긋나던 문제가 줄어든다. GLM-4.5-Air는 다중 토큰 예측(MTP)을 얻었고, 동반 승격된 ggml v0.22.0은 Metal 커널을 연산 단위 소스로 재구성해 병렬 컴파일을 도입했다. 서버에는 슬롯 진단용 LLAMA_SERVER_SLOTS_N_DIFF 노브가, 웹 UI에는 탭형 채팅 내비게이션이 붙었다.
💡로컬에서 대형 MoE를 굴리다 GPU 한 장에 안 들어가 접었다면 -sm tensor부터 다시 재보라. 멀티모달 전처리는 이제 파이썬 쪽과 리사이즈 결과를 맞춰볼 수 있다.
누가
ggml-org / llama.cpp 메인테이너 팀 (GitHub 릴리스 자동 배포)
무엇을
llama.cpp v0.3.0 릴리스 — dots3-note 멀티모달 모델(신규 DSA-ISWA KV 캐시) 지원, GLM-4.5-Air MTP(다중 토큰 예측), DeepSeek 4 텐서 분할 모드 `-sm tensor` 추가 및 다중 시퀀스 롤백 버그 수정, ggml v0.22.0 승격
언제
2026-08-25T10:22:58Z
대형 MoE·멀티모달 모델을 여러 GPU/백엔드에 쪼개 로컬에서 실행하려는 수요에 대응하고, meta 백엔드의 텐서 분할 상태 전파 버그와 DeepSeek 4 다중 시퀀스 롤백 오류를 해결하기 위해. Metal 커널을 op 단위 소스로 재구성해 병렬 컴파일도 도입
#llama.cpp#local-inference#deepseek#multimodal#ggml
이미지: AI 생성 이미지원문 →
Gemini CLI v0.57.0 릴리스의 GitHub 오픈그래프 카드. google-gemini/gemini-cli 저장소 이름과 저장소 지표가 함께 표시돼 있다.

Gemini CLI v0.57.0, 변경 절반이 에이전트 수정

구글이 Gemini CLI v0.57.0을 정식 릴리스했다. 릴리스 노트를 열면 변경 항목 25건 중 13건, 52%[SSR Agent] Issue Fix (이슈번호) 형식이다 — 사람이 아니라 에이전트가 이슈 백로그를 훑어 낸 수정이고, 전건이 자동 수정 PR 계정 하나로 저자가 찍혀 있다. 처리된 이슈는 TUI가 무한 대기하던 버그(21477), agents 모드를 꺼도 서브에이전트가 실행되던 문제(22093), 외부 에디터에서 빠져나온 뒤 터미널 버퍼가 갱신되지 않던 증상(24935), 시작 시 서브에이전트 핸드오프 토큰이 되돌아가던 회귀(28518) 같은 실사용 결함이다. 사람 손이 들어간 변경도 있다. capacity 에러를 조용히 재시도하며 가용성 TTL을 두는 처리, 다중 턴 요청이 취소되면 요청 전체를 롤백하는 수정이 그것이다.
💡자기 레포에도 몇 달 묵은 이슈가 쌓여 있다면 라벨을 붙여 에이전트에 맡기고, 그 비율을 릴리스 노트에 그대로 남겨보라. 위임이 실제로 먹혔는지 세어볼 수 있는 거의 유일한 방법이다.
누가
Google Gemini CLI 팀 — 릴리스 봇 gemini-cli-robot, 자동 수정 PR 저자 joneba-google
무엇을
Gemini CLI v0.57.0 정식 릴리스. 릴리스 노트의 변경 항목 24건 중 13건이 `[SSR Agent] Issue Fix (이슈번호)` 형식의 자동 에이전트 이슈 수정 PR
언제
2026-08-25T18:37:14Z
오픈소스 CLI에 수천 번대까지 쌓인 이슈 백로그(19239 /clear 문서, 21477 TUI 무한 대기, 22093 agents 모드 비활성 시 서브에이전트 실행, 24587 개인 계정 오인 에러 등)를 사람 리뷰 대신 에이전트가 훑어 처리하기 위해
#gemini-cli#oss#agent#maintenance#release
이미지: AI 생성 이미지원문 →
Codex 5시간 한도 복귀, Plus는 8/25부터

Codex 5시간 한도 복귀, Plus는 8/25부터

OpenAI가 ChatGPT Plus 구독자의 Codex·ChatGPT Work 5시간 사용 한도를 8/25부터 되살렸다. Codex·ChatGPT 엔지니어링 리드 Tibo Sottiaux가 X에 "내일 우리는 ChatGPT Work와 Codex 전반에 Plus 계정용 5시간 한도를 되돌린다"고 직접 알렸고, 9to5Mac이 31분 뒤 이를 받아 보도했다. 지난 몇 주 동안 OpenAI는 주간 한도만 남기고 5시간 창을 풀어둔 상태였다. 그 기간에는 두 플랫폼 통합과 활성 사용자 100만 추가 같은 마일스톤을 이유로 주간 사용량을 조기 리셋해 주기도 했다. 이제 5시간 창이든 주간 한도든 하나에 걸리면 다음 사이클까지 기다리거나 추가 크레딧을 사야 한다. 해커뉴스에는 104점과 117개 코멘트가 달렸다.
💡Plus 한 장으로 Codex를 종일 돌리던 사람이라면 긴 작업을 5시간 창 안에 끝나는 단위로 쪼개고, 무인 실행 스케줄을 창 경계에 맞춰 다시 짜야 한다.
누가
OpenAI — Thibault 'Tibo' Sottiaux (Codex·ChatGPT 엔지니어링 리드)
무엇을
ChatGPT Plus 구독자 대상으로 Codex와 ChatGPT Work의 5시간 사용 한도를 8월 25일부터 다시 적용한다고 발표
언제
2026-08-25T01:47:49Z (원 발표: Tibo Sottiaux, 2026-08-24 저녁 PT / X)
지난 몇 주간 주간 한도만 남기고 5시간 한도를 일시 해제했던 실험을 종료. 그 기간 동안 두 플랫폼 통합·활성 사용자 100만 추가 등 마일스톤을 이유로 주간 사용량을 조기 리셋해 주기도 했다
#openai#codex#rate-limit#chatgpt-plus#pricing
이미지: AI 생성 이미지원문 →
🏆

해커톤·대회

WebMCP Challenge 공식 키비주얼. 하늘색 그라데이션 배경에 'WebMCP Challenge' 흰색 타이포와 OpenAI 로고가 들어가 있다.

OpenAI가 상금 건 WebMCP 챌린지, 9/3 마감

OpenAI가 Devpost에서 WebMCP 챌린지를 열었다. 총상금 $35,000, 제출은 8/25 시작해 9/3 마감이라 실작업 기간이 9일뿐이다. WebMCP는 웹사이트가 에이전트에게 쓸 수 있는 툴을 구조화해 직접 노출하는 신생 개방 표준이다. 주최 측 설명은 "에이전트가 당신의 UI를 더듬어 추측하게 두는 대신, 어떻게 쓸 수 있는지를 당신이 정확히 정의한다"는 것. 심사 기준은 WebMCP를 얼마나 제대로 활용했는가, 실행 완성도, 파급력, 창의성 4가지다. 상위 10팀은 현금 $3,000에 Codex Micro와 ChatGPT Pro 1년, 스폰서 크레딧(Cloudflare $10,000, Vercel $4,200 등)을 받는다. 개시 하루 만에 참가 등록이 200명을 넘었고 마감까지 계속 붙는 흐름이다.
💡MCP 서버를 만들어 본 사람이라면 같은 사고방식을 자기 웹앱 프런트로 옮기는 데 주말이면 충분하다. 표준 초기라 레퍼런스 구현 자리가 아직 비어 있다.
누가
OpenAI 주최(Devpost 운영). 스폰서로 Cloudflare, Vercel, Netlify, Render, Shopify, Google Chrome 참여
무엇을
웹사이트가 에이전트에게 구조화된 툴을 직접 노출하는 신생 개방 표준 WebMCP를 활용해, 사람과 에이전트가 함께 쓰는 웹앱을 만드는 9일짜리 온라인 챌린지. 총상금 $35,000, 상위 10팀에 팀당 약 $3,500 상당(현금 $3,000 + Codex Micro + ChatGPT Pro 1년 + 스폰서 크레딧)
언제
모집·제출 시작 2026-08-25 12:00 PDT(= 08-26 04:00 KST), 제출 마감 2026-09-03 13:00 PDT, 심사 09-04~09-21, 수상자 발표 2026-09-23 14:00 PDT
심사 기준이 WebMCP Leverage(표준을 얼마나 제대로 활용했는가), Execution, Potential Impact, Creativity & Ambition 4가지. 에이전트가 UI를 추측해 더듬는 대신 사이트가 사용법을 명시적으로 선언하게 만들어 작업 정확도·속도를 올리는 것이 문제의식
#webmcp#mcp#openai#hackathon#devpost
이미지: AI 생성 이미지원문 →
행안부 AI 분석모델 대회, 상금 1억 2,600만원

행안부 AI 분석모델 대회, 상금 1억 2,600만원

행정안전부가 2026년 AI 기반 현안해결형 분석모델 개발 경진대회를 8/26 시작한다. 과제는 셋이다. 블랙박스 영상으로 교통사고 차량 거동을 분석하는 모델(국립과학수사연구원 제안), AI 딥보이스 탐지 모델, 수요기관 자체입찰 위반 모니터링 모델(조달청 제안). 총 21개 팀을 선정하고 총상금은 1억 2,600만원, 각 과제 대상에는 행정안전부 장관상이 붙는다. 제출은 데이콘 플랫폼에서 9/29까지 받고 최종 결과는 10/16 발표한다. 보도자료는 "민간의 다양한 기술과 아이디어를 공공분야에 접목해 실제 행정에 활용할 수 있는 AI 모델을 발굴하기 위해 마련했다"고 밝혔다. 보이스피싱 탐지·사고 과실 판단·입찰 감시처럼 판정 근거를 대야 하는 영역이라 정확도만큼 설명 가능성이 갈림길이 된다.
💡국내에서 실제 수요기관이 걸린 과제를 5주 안에 풀어볼 수 있는 자리다. 데이콘 계정만 있으면 참가되니 세 과제 중 이미 다뤄본 도메인 하나에 붙는 쪽이 승산이 높다.
누가
행정안전부(공공데이터분석관리과) 주최, 수요기관으로 국립과학수사연구원·조달청 참여, 데이콘(dacon.io)이 제출·평가 플랫폼
무엇을
'2026년 AI 기반 현안해결형 분석모델 개발 경진대회' — 3개 과제: ①블랙박스 영상 기반 교통사고 차량 거동 분석모델 ②AI 딥보이스 탐지모델 ③수요기관 자체입찰 위반 모니터링 모델. 총 21개 팀 선정, 총상금 1억 2,600만원
언제
보도자료 배포 2026-08-25(8/26 조간), 대회 개최 2026-08-26 시작, 모델 제출 마감 2026-09-29, 최종 결과 발표 2026-10-16
민간의 AI 기술·아이디어를 공공분야에 접목해 실제 행정에 바로 쓸 수 있는 모델을 발굴하겠다는 것. 보이스피싱 딥보이스 탐지, 교통사고 과실 판단, 조달 입찰 위반 감시처럼 판정 근거가 필요한 영역이라 정확도뿐 아니라 설명 가능성이 관건
#public-sector#dacon#deepfake-detection#computer-vision#korea
이미지: AI 생성 이미지원문 →
💰

매출·사례

Zoro 창업자 Aryan Mahajan의 인물 사진. 푸른 우드 패널 앞에서 가죽 재킷 차림으로 정면을 보고 있다. Indie Hackers 인터뷰 게시물에 본인이 제공한 사진.

23세 창업자의 월 $100k, 사업 전체 합산

Indie Hackers에 23세 창업자 Aryan Mahajan의 1인칭 인터뷰가 실렸다. 수치부터 보자. 원문은 "내가 소유하고 운영하는 사업들을 합치면 매출은 7자리이고, 매달 $100k 이상이 반복 매출"이다 — 대표 사업인 AI 인프라 회사 Zoro 한 곳의 매출이 아니라 본인이 소유·운영하는 사업 전체 합산이며, 감사 없는 자기신고 수치다. 시작은 2024년 9월, 아이디어도 돈도 없이 신용카드가 한도까지 찬 상태였다. 첫 고객은 Upwork 제안서 47건 끝에 붙은 $180짜리 부동산 챗봇. 제안마다 상대 회사 이름이 화면에 뜨는 맞춤 Loom 데모를 붙였다. 이후 납품 단위를 챗봇에서 자동화, 다시 업무 시스템으로 올려 '노력'이 아니라 '결과'를 팔았다. "이 사업에서 리드에 돈을 낸 적이 없다"고 했고, LinkedIn 영상으로 쌓은 팔로워 5만 중 한 게시물이 포춘 500 컨설팅사 계약으로 이어졌다.
💡AI 대행 일을 받고 있다면 파는 단위를 도구에서 결과로 올려보라. 돈·계약을 건드리는 행동에 사람 승인을 끼워두는 것만으로 대기업이 '실험'이 아니라 인프라로 받아들인다.
누가
Aryan Mahajan(23세), 로스앤젤레스 AI 인프라 회사 Zoro 창업자 겸 CEO. 본인이 소유·운영하는 사업 포트폴리오 전체를 직접 운영
무엇을
기업 운영에서 가장 비싼 업무 한 덩어리를 AI 시스템으로 대체해주고 구축비 + 월 구독을 받는 프로덕타이즈드 서비스 — '매월 $100k 이상 반복 매출(recurring), 소유 사업 전체 합산 7자리'라고 본인이 공개
언제
2026-08-25 Indie Hackers에 창업자 1인칭 인터뷰로 공개. 매출 시점은 인터뷰 시점 현재(2026년 8월) 기준 '매월 $100k 이상 반복 매출'
2024년 9월 달라스에서 아이디어도 돈도 없이 두바이로 건너가 신용카드가 전부 한도까지 찬 상태에서 시작. '창업자 본인이 자기 회사의 병목'이라는 문제를 잡아, 도구가 아니라 결과를 파는 쪽으로 프레임을 바꿨다
#indie-hackers#ai-agency#productized-service#claude-code#n8n
이미지: AI 생성 이미지원문 →
JobBoardSearch 서비스 소개 이미지. '채용 사이트 메타 디렉터리'라는 문구와 함께 노트북 화면에 채용 게시판 목록 UI가 띄워져 있다.

구인보드 디렉터리 4년, 누적 $100K 돌파

정적 HTML 한 장에 구인보드 12개를 적어 시작한 JobBoardSearch가 4년 만에 누적 매출 $100K를 넘겼다. 창업자 Rod(@rrmdp)의 Indie Hackers 마일스톤 글이다. 지금 등록된 니치 구인보드는 800개 이상인데, 스크래핑해 모은 게 아니라 보드 운영자들이 직접 등록한 것들이다. 서브레딧 26,000명·텔레그램 6,000명이 붙었고 매출원은 유료 노출·광고·제휴·등록 대행·구인보드 매매 마켓플레이스·SEO 감사로 흩어져 있다. 각 보드의 API·XML·RSS 피드 한 벌을 검색, 시간당 도는 Reddit 봇, 키워드 알림 텔레그램 봇, SEO 페이지에 재사용한다. 코드는 4년째 PHP·생 CSS·바닐라 JS 그대로다. 본인 결론은 "해자는 디자인이나 기술이 아니라 쌓인 트래픽·SEO 권위·데이터·커뮤니티, 수백 명의 보드 창업자와의 관계"다. 이 $100K는 누적이지 월 매출이 아니다.
💡"제품 개선과 사업 개선을 혼동하지 말라"가 이 글의 핵심이다. 리라이트 브랜치를 파기 전에, 이미 굴러가는 못생긴 것에 유입 채널을 하나 더 붙이는 쪽이 이기는지 먼저 재보라.
누가
Rod(@rrmdp), 니치 구인보드 디렉터리 JobBoardSearch 창업자. 뉴스레터만 아내가 돕고 나머지는 사실상 1인 운영
무엇을
4년 전 정적 HTML 한 장에 구인보드 12개를 적어 시작한 디렉터리 — 현재 창업자들이 직접 등록한 니치 구인보드 800개 이상, 누적 매출 $100K+, 서브레딧 26,000명·텔레그램 6,000명 커뮤니티
언제
2026-08-25 Indie Hackers에 창업자 본인이 '방금 $100K를 넘었다'며 처음 공개(누적 매출 기준)
구인보드를 스크래핑해 모으는 대신 보드 운영자들이 직접 등록하게 만들어, 데이터·관계·SEO 권위가 쌓이는 구조를 노렸다
#indie-hackers#directory#seo#bootstrapped#php
이미지: AI 생성 이미지원문 →
🎙

기술+사람 인터뷰

Dwarkesh Podcast의 Dylan Patel 편 에피소드 썸네일. 인터뷰 장면 위에 'Every force is screeching towards centralization.'라는 인용문이 얹혀 있다.

Dylan Patel, 랩이 추론 컴퓨트를 줄인다

Dwarkesh Podcast에 SemiAnalysis 창업자 Dylan Patel이 77분간 AI 랩 컴퓨트 경제학을 짚었다. 그는 "작년 말 기준 미국 GDP 성장 대부분이 AI 인프라였고, 올해 새로 켜지는 컴퓨트의 약 3분의 1은 OpenAI와 Anthropic 몫"이라고 말한다. 올해 capex는 1조 달러를 넘고 2028년에는 2조 달러를 넘어서며, 랩이 가져가는 비중은 계속 오른다는 것. 비합의적인 건 배분 전망이다. "랩들은 시간이 갈수록 추론에 배정하는 컴퓨트를 줄일 것이다. 대부분이 추론으로 간다는 게 통설이지만, 실제로는 매출을 내는 추론이 아니라 학습의 포워드 패스로 갈 것"이라고 한다. 근거는 단가다. 메가와트당 매출이 $30~40M에서 $60~70M로 오르면 추론에 40%를 쓰던 계산이 바뀐다. 그는 회차 후반 진행자에게 되물었다. "모든 힘이 중앙화로 비명 지르며 달려가는 것 같다. 그러지 않길 바란다."
💡API 단가가 지금 수준으로 유지된다는 전제로 원가를 짠 서비스라면 가정을 다시 세워야 한다. 랩의 기회비용이 오를수록 외부에 열리는 추론 용량과 가격이 먼저 압박을 받는다.
누가
인터뷰이: Dylan Patel — 반도체·AI 인프라 리서치사 SemiAnalysis 창업자 / 인터뷰어: Dwarkesh Patel (Dwarkesh Podcast 진행자)
무엇을
AI 랩(OpenAI·Anthropic)의 컴퓨트 경제학 — 두 랩이 2028년까지 세계 가용 FLOPs 대부분을 확보하는 경로, 추론에서 학습·R&D로의 컴퓨트 재배분, 그리고 10조 달러 규모 AI capex가 부를 국가부채 위기 가능성
언제
2026-08-25 15:32 UTC 공개 (Dwarkesh Podcast, 약 77분 정규 회차 — 게시 페이지 datePublished 2026-08-25T15:32:57+00:00 및 Substack RSS pubDate 동일 확인)
지금 AI 인프라 capex와 컴퓨트 가격은 모든 빌더의 API 단가·모델 선택지·창업 전략을 결정하는 상위 변수다. Patel은 '대부분의 컴퓨트가 추론으로 간다'는 업계 통설을 정면으로 반박하며 랩들이 오히려 추론 비중을 줄일 것이라는 비합의적 전망을 데이터와 함께 제시한다 — 컴퓨트 조달 계획을 세우는 쪽에는 시점상 직접적인 입력값이다.
#compute#semianalysis#podcast#inference#capex
이미지: AI 생성 이미지원문 →

이 호가 도움됐다면 공유해 주세요.

📤 공유하기𝕏@inf💬B