OpenAI가 GPT-4o의 비전(Vision) 입력을 포함한 파인튜닝 기능을 정식 출시하며, 이미지와 텍스트를 함께 학습 데이터로 사용할 수 있게 됐다. UI 스크린샷 분류, 제품 이미지 설명 자동화 등 멀티모달 커스텀 모델이 필요한 개발팀의 진입 장벽이 크게 낮아질 전망이다.
AI 자동 초안 · 관리자 검토 전 — 스크립트가 자동 작성한 초안이에요. 중요한 결정 전 원문을 다시 확인해주세요.
Anthropic, Claude Haiku 4.5 배치 API 처리량 2배 확대 및 비용 구조 개편
Anthropic이 Claude Haiku 4.5의 배치(Batch) API 처리 한도를 기존 대비 2배로 상향하고, 대용량 문서 파이프라인에 최적화된 티어 요금제를 도입했다. 반복적인 데이터 전처리·번역·요약 작업을 자동화하는 한국 개발팀에게 인프라 비용 절감의 직접적인 기회가 생겼다.
AI 자동 초안 · 관리자 검토 전 — 스크립트가 자동 작성한 초안이에요. 중요한 결정 전 원문을 다시 확인해주세요.
GitHub이 Copilot Workspace의 멀티에이전트 병렬 태스크 실행 기능을 정식 GA로 전환했다. 이슈 하나를 여러 서브태스크로 자동 분해한 뒤 독립 에이전트가 동시에 코드를 작성·테스트·PR까지 완성하며, Copilot Enterprise 구독자는 추가 비용 없이 즉시 사용 가능하다.
AI 자동 초안 · 관리자 검토 전 — 스크립트가 자동 작성한 초안이에요. 중요한 결정 전 원문을 다시 확인해주세요.
유럽연합이 범용 AI(GPAI) 모델 제공자를 위한 '실천규범(Code of Practice)' 최종본을 공식 확정하고 2026년 8월 2일부터 발효된 GPAI 의무 조항과 연동했다. EU 시장에 AI 기반 SaaS를 공급하거나 공급 예정인 한국 스타트업·중견기업은 투명성 보고서, 저작권 정책 문서화, 시스템적 위험 평가 세 가지를 우선 준비해야 한다.
AI 자동 초안 · 관리자 검토 전 — 스크립트가 자동 작성한 초안이에요. 중요한 결정 전 원문을 다시 확인해주세요.
OpenAI, Realtime API WebRTC 모드 정식 GA — 음성 지연 400ms 이하
OpenAI가 Realtime API의 WebRTC 전송 모드를 정식 일반 공개(GA)하며 평균 왕복 지연을 400ms 이하로 낮췄다. 서버 측 WebSocket 세션 없이 브라우저·모바일 앱에서 직접 저지연 음성 스트리밍을 구현할 수 있어, 실시간 인터랙션 서비스를 구축하는 한국 개발자의 아키텍처가 크게 단순해진다.
AI 자동 초안 · 관리자 검토 전 — 스크립트가 자동 작성한 초안이에요. 중요한 결정 전 원문을 다시 확인해주세요.
Google DeepMind, Gemini Flash 2.5 컨텍스트 2M 토큰 정식 GA
Google DeepMind가 Gemini Flash 2.5의 컨텍스트 윈도우를 200만 토큰으로 확장해 정식 GA로 전환했다. 대규모 코드베이스 전체를 단일 프롬프트에 입력하거나 수백 편의 문서를 한 번에 분석하는 워크플로가 가능해져, 한국 개발자의 장문 RAG 파이프라인과 영상·문서 기반 크리에이터 도구 개발에 직접적인 영향을 준다.
AI 자동 초안 · 관리자 검토 전 — 스크립트가 자동 작성한 초안이에요. 중요한 결정 전 원문을 다시 확인해주세요.
Meta, Llama 3.3 405B 4비트 양자화 공식 배포 — 소비자 GPU 구동 가능
Meta가 Llama 3.3 405B 모델의 공식 4비트 GGUF·AWQ 양자화 가중치를 Hugging Face를 통해 공개했다. 단일 RTX 4090(24 GB VRAM) 또는 M2 Ultra Mac Studio(192 GB 통합 메모리)에서 구동 가능한 수준으로 압축돼, 클라우드 비용 없이 로컬에서 대규모 모델을 실험하려는 개발자·크리에이터에게 실질적인 선택지가 열렸다.
AI 자동 초안 · 관리자 검토 전 — 스크립트가 자동 작성한 초안이에요. 중요한 결정 전 원문을 다시 확인해주세요.
OpenAI가 o3-mini 모델의 아시아-태평양 리전 확장 일환으로 한국(서울) 엣지 라우팅을 공식 지원하며 평균 응답 지연을 기존 대비 약 40% 단축했다. 동시에 o3-mini의 입력·출력 토큰 단가를 각각 30% 인하해 추론 집약적 서비스를 운영하는 국내 개발자의 비용 부담이 크게 줄어들 전망이다.
AI 자동 초안 · 관리자 검토 전 — 스크립트가 자동 작성한 초안이에요. 중요한 결정 전 원문을 다시 확인해주세요.
Google, Gemini Code Assist 2.0 정식 출시 — 멀티파일 리팩터링·CI 연동 강화
Google DeepMind가 Gemini Code Assist 2.0을 정식 공개하며 멀티파일 컨텍스트 처리 한도를 기존 대비 4배 확장하고, GitHub Actions·GitLab CI와의 네이티브 파이프라인 연동 기능을 추가했다. 한국 개발자에게는 VS Code·JetBrains 플러그인 모두 즉시 업데이트가 제공되며, 개인 무료 티어(월 2,000회 코드 완성)는 유지된다.
AI 자동 초안 · 관리자 검토 전 — 스크립트가 자동 작성한 초안이에요. 중요한 결정 전 원문을 다시 확인해주세요.
Anthropic, Claude Sonnet 4.6 프롬프트 캐시 TTL 최대 2시간으로 연장
Anthropic이 Claude Sonnet 4.6의 프롬프트 캐싱 TTL을 기존 5분에서 최대 2시간으로 연장했다. 동일 컨텍스트를 반복 호출하는 서비스에서 입력 토큰 비용을 대폭 절감할 수 있어, 챗봇·코딩 어시스턴트 등 고빈도 API 호출 제품에 즉각적인 영향을 준다.
AI 자동 초안 · 관리자 검토 전 — 스크립트가 자동 작성한 초안이에요. 중요한 결정 전 원문을 다시 확인해주세요.
GitHub Copilot, 기본 모델을 Claude Sonnet 계열로 교체—코드 완성 정확도 개선
GitHub이 Copilot Individual·Business·Enterprise 전 플랜에서 코드 완성 및 인라인 채팅의 기본 백엔드 모델을 Claude Sonnet 계열로 전환했다. 특히 멀티파일 리팩터링과 타입 추론 정확도가 이전 GPT 계열 대비 향상됐다는 내부 벤치마크 수치를 함께 공개했다. 별도 추가 비용 없이 기존 구독자에게 즉시 적용되며, 원하면 설정에서 모델을 수동 전환할 수 있다.
AI 자동 초안 · 관리자 검토 전 — 스크립트가 자동 작성한 초안이에요. 중요한 결정 전 원문을 다시 확인해주세요.
Cursor가 Model Context Protocol(MCP) 서버를 개발자 로컬 환경 또는 사내 인프라에서 직접 호스팅할 수 있는 기능을 정식 출시했다. 이를 통해 사내 코드베이스, 위키, 이슈 트래커 등 외부로 반출이 어려운 데이터를 AI 컨텍스트로 안전하게 활용할 수 있다. 보안 정책이 엄격한 금융·공공 분야 한국 기업 개발팀에게 실질적인 도입 경로가 열렸다는 점에서 주목받고 있다.
AI 자동 초안 · 관리자 검토 전 — 스크립트가 자동 작성한 초안이에요. 중요한 결정 전 원문을 다시 확인해주세요.
Meta가 Hugging Face Hub를 통해 Llama 4 Maverick 기반의 한국어 특화 LoRA 어댑터와 공식 파인튜닝 레시피를 공개했다. 한국어 벤치마크(KoBEST, HAE-RAE) 기준 기존 Llama 3.3 70B 대비 평균 11%p 향상된 수치가 함께 제시됐으며, 국내 개발팀의 도메인 특화 모델 구축 진입 장벽이 크게 낮아질 전망이다.
AI 자동 초안 · 관리자 검토 전 — 스크립트가 자동 작성한 초안이에요. 중요한 결정 전 원문을 다시 확인해주세요.