본문으로 건너뛰기
vibecamp ai builder 목록

vibecamp ai builder · #49 · 2026-07-24

vibecamp ai builder 2026-07-24 — 이미지·영상·오디오 통합 FLUX 3 공개, 로봇 액션 모델 FLUX-m

2026-07-24 AI 빌더 일간 호 — 오늘 8개 카드를 정리했습니다.

8개 카드 · AI Agent 를 만드는 사람의 일간

📤 공유하기𝕏@inf💬B
🛠

빌더 신호

이미지·영상·오디오 통합 FLUX 3 공개, 로봇 액션 모델 FLUX-mimic까지

#
Black Forest Labs가 7/23 이미지·비디오·오디오를 단일 아키텍처로 함께 학습하는 멀티모달 파운데이션 모델(multimodal foundation model) FLUX 3를 Early Access로 공개했습니다. 네이티브 오디오가 포함된 최대 20초 영상을 text-to-video로 생성하고 Runway Gen-4.5 대비 77% 비교에서 우세했습니다. 같은 날 mimic robotics와 만든 로봇 video-action 모델 FLUX-mimic도 Audi 공장에 실제 배포했는데, 기존 30시간+가 필요하던 조작 태스크를 단 30분 데이터로 파인튜닝하고 RTX 5090 단일 GPU에서 backbone <80ms(엔드투엔드 101ms)로 구동합니다.
💡생성형 AI 랩이 로봇 액션까지 단일 백본으로 확장했습니다. 30분 데이터·단일 GPU 온프레미스 구동이라 생성 AI와 물리 AI(physical AI)의 경계가 좁혀지는 지점을 직접 확인할 수 있습니다.
원문 →#multimodal#video-generation#robotics#flux#physical-ai

Claude 음성 모드에 Opus·Sonnet 개방 + Gmail·Slack·Canva 연동

#
Anthropic이 7/23 Claude 음성 모드에 처음으로 Opus·Sonnet 모델을 개방했습니다. 그동안 음성 모드는 즉답 위주의 Haiku만 지원했지만, 이제 모델 피커에서 Haiku/Sonnet/Opus를 대화 중간에도 전환할 수 있습니다. 음성 모드가 Gmail·Slack·Canva 등 커넥터(connector)에서 사용자 허가 하에 컨텍스트를 끌어오고, 11개 언어를 지원하며 언어 전환도 됩니다. 텍스트↔음성 모드를 대화 중간에 오갈 수 있고, turn-based 아키텍처(듣기→생각→응답)로 모바일·데스크톱·웹 전반에 배포됐습니다.
💡음성이 텍스트와 동급의 개발 표면(surface)으로 올라섰습니다. Claude로 에이전트·워크플로를 만든다면 음성 인터페이스에서도 강력 모델과 커넥터 도구 호출을 그대로 결합할 수 있습니다.
원문 →#claude#voice#anthropic#connectors#agent

Microsoft, PowerPoint·Bing의 OpenAI 이미지 모델을 자체 MAI-Image-2.5로 교체

#
Microsoft가 7/23 PowerPoint·Bing에 쓰이던 OpenAI 이미지 생성 모델을 자체 기술 MAI-Image-2.5로 교체 중이라고 Bloomberg가 보도했습니다. 이 모델은 이미 PowerPoint·OneDrive에 임베드됐고, Microsoft AI CEO Mustafa Suleyman은 '더 빠르고 더 싸고 더 높은 품질이며 리텐션을 개선한다'고 밝혔습니다. Excel·Outlook·GitHub Copilot에서 OpenAI·Anthropic 모델을 자체 MAI로 바꿔 비용을 줄이려는 전략의 일부로, Suleyman은 'Anthropic에 많은 돈을 지불한다 — 목표는 그 비용을 줄이고 궁극적으로 제거하는 것'이라고 말했습니다. MAI 모델군은 2026년 6월 Build에서 처음 공개됐습니다.
💡대형 플랫폼이 프런티어 벤더 의존을 자체 모델로 수직통합하는 흐름이 이미지 도메인까지 번졌습니다. Microsoft 스택 위에서 만드는 빌더라면 이미지 생성 백엔드가 바뀌는 것을 체감하게 됩니다.
원문 →#microsoft#image-generation#vertical-integration#mai#cost
🏆

해커톤·대회

코드게이트 CTF 2026 — 인간 화이트햇 vs KAIST AI 해커 첫 정식 대결

#
코드게이트 CTF 2026(18회) 본선이 7/23 오전 9시부터 7/24 오전 9시까지 24시간 동안 서울 코엑스에서 진행 중입니다. 일반부 21개 팀이 참가했고, KAIST와 공동 개발한 'AI 해커'가 국내 최초로 인간 화이트햇과 같은 환경에서 겨루는 Jeopardy(문제풀이형) 대결을 벌입니다. AI 해커는 오전 10시 30분 750점 18위에서 오후 2시 7위로 급상승했고, 다이내믹 스코어링(많이 풀수록 배점 하락) 방식이라 순위가 수시로 바뀝니다. 최종 순위는 7/24 오전 종료 후 확정됩니다. 일반부 상금은 우승 5,000만원입니다.
💡자율 보안 에이전트가 인간 전문가와 대등한 순위권에 오른 첫 국내 사례입니다. '취약점 자동 탐색' 에이전트의 현재 실력 수준을 가늠할 벤치마크성 이벤트로 참고할 수 있습니다.
원문 →#ctf#security#ai-agent#codegate#korea
🎙

빌더 인터뷰

리사 수 × 샘 올트먼: AMD 'Advancing AI 2026' 키노트 대담

#
AMD가 7/23 샌프란시스코 'Advancing AI 2026' 키노트에서 MI400 가속기, Helios 랙스케일 시스템, TSMC 2나노 기반 x86 서버 CPU EPYC Venice를 공개했습니다. 리사 수 CEO가 무대에 OpenAI CEO 샘 올트먼과 공동창업자 그레그 브록만을 초청해 대담했고, OpenAI는 최대 6GW의 AMD 인프라를 배치하며 2026년 4분기부터 Helios를 가동한다고 밝혔습니다. Meta는 Venice·MI450 리드 파트너로 참여했고, OpenAI와 Meta는 합산 12GW 가속기 용량을 커밋했습니다. 리사 수는 MI300X 대비 1,000배 성능을 주장하는 MI500 로드맵도 예고했습니다.
💡빌더가 가져갈 멘탈 모델: 모델·에이전트 성능은 결국 확보 가능한 컴퓨트와 공급 계약 규모에 종속됩니다. 인프라 계층의 벤더 다변화·물량 커밋을 읽으면 프런티어 역량의 상한선을 역산할 수 있습니다.
원문 →#amd#compute#openai#keynote#infrastructure
🦅

claw 생태계

serena, 에이전트의 IDE로 정식 등재

#
clawfit 스캔 코퍼스에서 가장 많이 인용되던 외부 MCP 서버 oraios/serena(⭐26,793)가 4월부터 6+개 문서(crabtrap·code-review-graph·codebase-memory-mcp 등)의 "코드 내비게이션 MCP 기준점"으로 계속 소환되다가 2026-07-23 마침내 첫 전용 신호로 등재됐다. serena는 코드베이스를 에이전트용 편집 가능 워크스페이스로 바꾸는 L4c 액션 인프라로, 시맨틱 심볼 검색·정의로 이동·참조 찾기·파일 읽기/쓰기 편집을 전부 표준 MCP 툴 콜로 노출한다. "the IDE for your agent"라는 자기 규정은 에이전트 런타임의 IDE급 내비게이션 원시기능을 보완이 아니라 대체하겠다는 의도다. 7-21 v1.6.1 릴리스, GitHub Trending Python 5위. clawfit은 이를 등재하며 "26k 스타 도구를 배경 소음처럼 취급한 캘리브레이션 오류"라고 자평했다.
💡💡 L1 에이전트(Claude Code) 단독이 아니라 Claude Code + serena(L4c) 페어링을 기본 코드젠 스택으로 검토하라. clawfit 레지스트리조차 아직 companion_mcp_server 필드가 없어 이 조합을 표현 못 하니, 도구 선택은 각자 명시적으로 챙겨야 한다.
원문 →#L4c#mcp#code-intelligence#serena#claw

screenpipe, 화면을 24/7 앰비언트 컨텍스트로

#
YC S26 백업을 받는 mediar-ai/screenpipe(⭐20,400)가 2026-07-23 Launch HN과 함께 clawfit L5 첫 "패시브 앰비언트 컨텍스트 캡처" 신호로 등재됐다. Rust 로컬 앱이 화면·오디오를 24/7 녹화해 OCR+음성 전사를 타임스탬프 멀티모달 로그로 로컬 DB에 쌓고, 에이전트는 MCP로 자연어·시간대 질의를 던진다. 구조적 차별점: mem0·Engram·OpenWiki 등 기존 L5는 사용자가 "이미 알려준" 컨텍스트를 저장하지만, screenpipe는 사용자가 그냥 일하는 것만으로 화면 상태 자체가 진실 원천이 된다 — 주석·서술 없이 수동적으로 축적. 로컬 우선·프라이버시 설계(캡처·저장·처리 전부 온디바이스)지만 LLM 질의 경로는 별도 엔드포인트가 필요하다. app-v2.5.132가 오늘 릴리스로 132번째 패치, 매우 높은 반복 케이던스를 보인다.
💡💡 task: code-gen + statefulness: session 프로파일에 주석 없이 채워지는 L5 컨텍스트 옵션이 생겼다. 단, screenpipe는 자격증명·기밀 문서까지 전부 캡처하므로 도입 시 data_sensitivity: confidential을 전제로 깔고 저장 암호화·오프라인 질의 가능 여부를 먼저 검증하라.
원문 →#L5#ambient-context#mcp#screenpipe#claw

OneCLI, 에이전트에 키 대신 스코프 토큰

#
onecli/onecli(⭐2,571)가 2026-07-23 Show HN과 함께 clawfit 첫 "에이전트 크리덴셜 게이트웨이" 신호로 등재됐다. 에이전트와 외부 서비스 사이에 끼어 원시 API 키를 노출하는 대신 키는 내장 볼트에 두고, 에이전트에는 호출당 발급되는 스코프 토큰만 준다 — 감사·레이트리밋·폐기가 원 크리덴셜 회전 없이 가능하다. 핵심 보안 주장: "에이전트가 침해·혼란·오작동해도 애초에 키를 쥐고 있지 않으니 유출·오용이 불가능하다." 기존 L5 보안 신호와 층이 다르다 — Traceforce는 런타임 행위 모니터링, ReasonGate는 사전 프롬프트 인젝션 방어인데 OneCLI는 크리덴셜 노출 표면만 정조준한다. v1.42.0(오늘)이 "unified first-match policy engine"을 도입, 4.5개월간 42 릴리스로 활발하다. 다만 ⭐2,571은 clawfit 5,000 임계선 아래라 레지스트리 미등재.
💡💡 governance_need: hard + network: online 프로파일이라면 프로덕션 서비스에 붙는 에이전트의 API 접근에 감사·폐기 레일이 필수인데 기존 정책엔진(ReasonGate·Traceforce)은 크리덴셜 벡터를 못 덮는다. OneCLI로 그 슬롯을 메우되, 볼트가 로컬인지 호스티드인지(오프라인 배포 가부)·토큰 스코프 범위를 먼저 확인하라.
원문 →#L5#security#credential-gateway#onecli#claw

이 호가 도움됐다면 공유해 주세요 — 빌더 한 명이 더 알게 됩니다.

📤 공유하기𝕏@inf💬B
vibecamp ai builder 2026-07-24 — 이미지·영상·오디오 통합 FLUX 3 공개, 로봇 액션 모델 FLUX-m | vibecamp ai builder