OpenAI는 스타게이트 인프라용 자체 개발 첫 AI 칩을 공식 출시했다.
이번 주 AI 업계의 관심은 맞춤형 추론 하드웨어, 고효율 멀티모달 모델, 그리고 온디바이스 인텔리전스에 집중되어 있습니다. 오픈AI가 자체 추론 칩을 개발하고, Z.ai가 비용 최적화 모델을 출시하며, Liquid AI가 소비자 기기에서 직접 모델을 벤치마킹할 수 있는 새로운 프레임워크를 선보이는 등, 인공지능은 더 빠르고 효율적으로 진화하며 최종 사용자 근처에서 작동하는 능력이 점차 강화되고 있습니다.
오픈AI는 브로드컴과 공동 개발한 맞춤형 AI 추론 칩인 '자라페뇨(Jalapeño)'의 초기 성능 데이터를 공개했습니다. 대규모 언어 모델 서빙 워크로드에 특화된 이 칩은 연산, 메모리 이동, 네트워킹, 추론 서빙 전반에 걸쳐 통합 최적화를 구현합니다. 초기 벤치마크 결과에 따르면 자라페뇨는 유사한 NVIDIA 블랙웰 기반 시스템 대비 와트당 연산 성능이 1.5~1.9배 높고 지연 시간은 1.7~3.6배 낮습니다. 많은 아키텍처가 처리량과 지연 시간 간 트레이드오프를 강요하는 것과 달리, 자라페뇨는 두 가지 성능을 동시에 향상하도록 설계되었습니다. 오픈AI에 따르면 이 칩은 이미 ChatGPT 응답 시간을 단축했으며 Codex 세션 및 에이전트의 반응성을 개선했으며, 이는 하드웨어와 소프트웨어의 공동 설계가 가져오는 장점을 입증합니다. 또한 자라페뇨는 다세대 AI 컴퓨팅 플랫폼의 첫 번째 버전으로, 더 광범위한 배포는 2026년 후반에 예정되어 있습니다.
Z.ai는 GLM-5 패밀리 내에서 최초로 네이티브 멀티모달 모델인 'GLM-5.3-Flash'를 출시했습니다. 이 모델은 추론 비용을 최소화하면서 최첨단 수준의 기능을 제공하도록 설계되었습니다. 총 파라미터 수는 3,200억 개이지만 180억 개만 활성화되는 하이브리드 디자인을 채택하여 희소 주의(sparse attention)와 선형 주의(linear attention) 메커니즘을 결합했습니다. 이 접근 방식은 GLM-5.3 대비 주의 계산량을 약 3배 줄이고 KV 캐시 요구 사항을 약 4.4배 절감하여 긴 컨텍스트 및 에이전트 워크로드의 효율성을 크게 개선합니다. 100만 토큰 컨텍스트 윈도우를 지원하며 텍스트, 이미지, 스크린샷, 코드에 대한 네이티브 시각 처리 기능을 추가했습니다. 특히 코딩, 시각적 이해, 장기 에이전트 워크플로우에 최적화되어 있으며 경쟁력 있는 API 가격 책정으로 대용량 비용 민감형 애플리케이션에 실용적인 솔루션으로 positioning되고 있습니다. 해당 모델은 Z.ai의 코딩 생태계를 통해 접근 가능하며, 빈번하고 자원 효율적인 AI 배포를 위해 마케팅되고 있습니다.
Liquid AI는 'Pipette'라는 오픈소스 벤치마킹 플랫폼을 출시했습니다. 이 플랫폼은 중요한 실무 질문인 '어떤 AI 모델이 내 특정 기기에서 가장 잘 작동하는가?'에 답하기 위해 설계되었습니다. Pipette는 모델을 고립된 상태로 평가하는 대신 모델 아키텍처, 양자화 방법, 런타임, 하드웨어, 컨텍스트 길이, 속도, 지연 시간, 메모리 소비량, 출력 품질을 포함한 전체 배포 스택을 평가합니다. 최초의 공개 데이터셋은 30개 이상의 모델, 양자화 기술, 런타임, 기기, 컨텍스트 길이를 아우르는 1,000개 이상의 구성을 포함하며, macOS, Windows, iOS, Android용 벤치마크 클라이언트가 제공됩니다. 이 플랫폼은 대화형 리더보드와 대시보드를 갖추고 있어 개발자가 클라우드 벤치마크나 파라미터 수에만 의존하지 않고 실제 온디바이스 성능을 기준으로 모델을 비교할 수 있게 합니다. 소형 모델과 엣지 AI의 성능이 향상됨에 따라 이러한 세분화된 평가는 필수적입니다. 서버 환경에서 뛰어난 성능을 보이는 모델도 스마트폰이나 노트북에서는 현저히 다른 결과를 보일 수 있기 때문입니다. Pipette는 로컬 AI 애플리케이션을 구축하는 개발자들이 이러한 성능 차이를 측정 가능하고, 재현 가능하며, 실행 가능한 형태로 활용할 수 있도록 하는 것을 목표로 합니다.
Claude AI Design은 사용자에게 간단한 프롬프트, 스크린샷, 웹사이트 메타데이터를 사용하여 정교한 제품 데모 비디오를 생성할 수 있는 기능을 제공합니다. 고급 편집 전문 지식 없이도 프레젠테이션과 시각적 스토리텔링을 위한 간소화된 디자인 AI 역할을 수행합니다. X1은 단일 프롬프트 생성의 함정을 피하며 개념부터 게시 가능한 iPhone 앱까지 개발자를 단계별로 안내하는 AI 앱 빌더입니다. Expertise AI는 AI 스킬을 생성, 배포, 공유, 수익화할 수 있는 플랫폼을 제공합니다. 전문가들은 보호된 플레이북을 독립형 스킬로 게시할 수 있으며, 기업은 이를 즉시 설치하거나 자체적으로 커스터마이징함으로써 조직 전체에 기관지식을 확장할 수 있습니다. ChatCut Desktop은 인간-에이전트 협업 워크로FLOW에 적합한 AI 기반 비디오 편집기를 도입했습니다. 사용자는 자연어를 통해 편집을 지시하거나 ChatGPT, Codex, Claude Code를 통합하여 변경 사항이 완전히 편집 가능한 타임라인에 렌더링되는 과정을 확인할 수 있습니다. MCP-Builder.ai는 호스팅되고 보안이 강화된 MCP 서버 생성을 단순화합니다. MCP 커넥터용 Lovable과 유사하게 작동하며, 사용자 설명을 기반으로 커넥터를 자동으로 빌드, 호스팅, 보안 처리하여 수동 인프라 및 보안 구성을 제거합니다. Tellie Prompter 1.5는 고정된 텍스트에 강제로 따르게 하기보다 화자에 적응함으로써 텔레프롬프터 기능을 재정의합니다. 실시간 음성을 청취하여 일시 정지, 즉흥 연기, 또는 대본 이탈을 허용하며, 버전 1.5는 원활한 전달을 위해 upcoming 내용을 예측합니다. ify는 마이그레이션을 요구하지 않고 기존 헬프데스크 플랫폼(예: Freshdesk, Zendesk, Salesforce, HubSpot) 위에 직접 통합됩니다. 이메일, 채팅, WhatsApp, Slack 등 다양한 채널에서 운영되며 고객 지원 워크로FLOW를 자동화합니다. JD.com은 최대 5분 길이의 장편 멀티샷 오디오-비디오 콘텐츠를 생성하는 프레임워크인 'JoyAI-Echo'를 오픈소스로 공개했습니다. 이 시스템은 샷 간 캐릭터와 음성 일관성을 유지하며 추론 속도가 7.5배 향상되었음을 보고합니다. Apple은 M6 및 M5 Ultra 칩을 출시하여 실리콘 라인업을 확대했으며, 이는 성능과 AI 컴퓨팅 측면에서 상당한 향상을 가져왔습니다. M5 Ultra는 최대 512GB의 유니파이드 메모리를 지원하여 Mac Studio가 demanding한 AI 워크로FLOW를 로컬에서 실행하는 능력을 크게 향상시킵니다. Google Cloud는 Gemini Enterprise for Legal을 출시하여 AI 에이전트를 엔터프라이즈 데이터 및 법률 전용 도구와 통합함으로써 계약 검토, 문서 분석, 규제 추적, 연구 및 관련 워크로FLOW를 지원합니다. ApodexAI의 오픈소스 FrontierAgent는 개발자가 복잡하고 다단계 작업을 위한 자율적 AI 에이전트를 구축할 수 있도록 지원합니다. ReAct 모드와 Agent Team 모드를 지원하며 명령줄 인터페이스를 통해 에이전트 개발을 간소화합니다. IBM은 Granite 4.2를 출시하여 Granite AI 모델 패밀리를 확장했으며, 이는 향상된 코딩 및 추론 기능을 도입합니다. 이번 릴리스는 합성 훈련 데이터가 어려운 소프트웨어 엔지니어링 작업에서의 성능을 어떻게 향상시킬 수 있는지 보여줍니다. Meta는 슈퍼인텔리전스 랩(Superintelligence Labs)을 위해 AI 연구원 Luke Metz를 영입했으며, 이는 최고급 AI 연구원을 확보하기 위한 치열한 경쟁 속에서 OpenAI와 Thinking Machines로부터 또 다른 주요 인재 영입 사례입니다.
마지막으로, 새로운 연구에 따르면 멀티에이전트 AI 시스템이 독립적으로 정답을 도출함에도 불구하고 널리 퍼진 오답을 선택할 수 있는 것으로 나타났습니다. 15,336개의 질문과 81,390개의 후보 풀을 대상으로 한 테스트에서 연구진은 답변 빈도 지표와 LLM 기반 판단을 결합하면 정확도가 63.82%에서 70.95%로 향상됨을 발견했습니다. 이 결과는 단순히 에이전트 수를 늘리거나 숙의 기간을 연장하는 것보다 답변 선택 메커니즘을 정교화하는 것이 더 큰 성능 향상을 가져올 수 있음을 시사합니다.