AI 시장 지각변동: Gemini 4와 에이전트 시대의 서막

요즘 AI 판이 어떻게 돌아가는지 따라가다 보면 진짜 정신이 하나도 없다. 아침에 일어나면 새로운 모델이 튀어나와 있고, 저녁에 잘 때쯤이면 어제까지 최강이라던 녀석이 구버전이 되어 버리는 일이 일상다반사다. 💡

이번에 유튜브 채널과 업계 동향을 쭉 훑어보면서 느낀 건, 이제 단순한 기술 경쟁을 넘어 에이전트와 인프라 전체가 거대한 지각변동을 겪고 있다는 사실이다.

제미나이 4 아르곤과 구글의 승부수

압도적인 벤치마크와 100만 토큰 출력의 실체

구글이 드디어 칼을 뽑아 들고 제미나이 4 아르곤(Gemini 4 Argon)을 세상에 내놓았다. 현재 일부 테스터들에게만 먼저 풀리고 있는 단계인데, 공개된 지표를 보면 진짜 눈이 돌아갈 정도로 화려하다. 논리 지워크(Logic Work)에서는 경쟁 모델들을 한참 따돌렸고, 오토메이션 벤치 1위, 딥 소프트 엔지니어 코딩 1위, 바이브 코드 벤치 1위를 싹쓸이했다고 한다. 📉 가격 경쟁력도 무시무시해서 입력 2달러, 출력 10달러라는 파격적인 조건으로 나왔다. 아티피셜 아날로그 조사 기관에 따르면 GPT-6 아스트라급과 동등한 53.3점을 기록했는데, 가격은 아스트라가 3.26달러인 것에 비해 아르곤은 1.99달러로 훨씬 저렴하다.

📊 출력이 100만 토큰이라고?

이번 아르곤 모델에서 가장 소름 돋는 지점은 컨텍스트 창 크기가 아니라 '100만 토큰 출력 제한'이다. 보통 다른 모델들은 출력이 64k를 넘어가면 헉헉거리는데, 한 번에 뽑아내는 양 자체가 체급이 다른 수준이다.

환각(Hallucination) 레이트도 15%밖에 안 된다. GPT-6 아스트라가 45%, 페이블이 70%를 넘는 것과 비교하면 엄청나게 정직하게 대답하는 셈이다.

하지만 모든 게 완벽할 리가 없다. 블룸버그 기사를 보면 구글 내부 직원들조차 제미나이 4의 코딩 성능을 두고 우려를 쏟아내고 있다고 한다. 벤치마크 점수만 높고 실제 제품 개발이나 프론트엔드 디자인 같은 복잡한 작업에서는 삐걱거린다는 지적이다. 이른바 '벤치맥싱' 현상에 갇힌 게 아닐까 싶을 정도로, 겉보기 점수와 실제 현업에서의 체감 성능 사이에 괴리가 존재한다는 목소리가 나온다. 매우 거대한 모델인 만큼 실행 비용이 감당하기 힘들 정도로 불어날 수 있다는 경고도 틀린 말이 아닐 것이다.

유료화 장벽과 신스 아이디 바이오의 등장

성능 자랑도 잠시, 구글은 곧바로 무서운 속도로 지갑을 열게 만드는 정책 업데이트를 단행했다. 10월 9일부터 적용되는 방침에 따르면, 무료 사용자는 오직 플래시 라이트(Flash-Lite)밖에 못 쓴다. 플러스 등급이라도 써야 플래시를 만져볼 수 있고, 프로 모델을 쓰려면 무조건 AI 프로를 구독해야 한다. 제미나이 4 출시에 발맞춰 딥싱크(DeepSync) 같은 알짜배기 옵션들도 전부 유료 구독자 전용으로 묶어버렸다.

본문 이미지 1

여기에 웹페이지와 앱 디자인을 도와주는 AI 툴인 스티치(Stitch) by Google과 함께 MCP(Model Context Protocol) CLI까지 내놓으면서 개발 생태계를 단단히 조여 매고 있다. 디자인을 만들어서 로컬 코딩 에이전트에 곧바로 연결해 개발할 수 있는 파이프라인을 구축한 것이다. 더 흥미로운 건 기술의 부작용을 사전에 차단하려는 움직임이다. 이미지나 영상에만 붙이던 워터마크를 이제는 생물학적 영역까지 확장했다. '신스 아이디(SynthID) Bio'를 통해 단백질 같은 생체분자를 AI가 생성할 때 아미노산 선택을 미묘하게 유도하여 고유의 지문을 새겨넣는다고 한다. 단백질의 원래 기능은 전혀 손상시키지 않으면서 워터마크 역할을 하게 만드는 것이다. "유기물 워터마크라니, 복제 인간 시대를 대비하는 걸까?" 하는 생각이 스칠 정도로 기술의 발전 속도가 두렵고도 놀랍다.

OpenAI DevDay 2026과 에이전트의 전면전

원격 컴퓨터 환경을 품은 에이전트 다츠(Dats)

오픈AI의 최대 개발자 행사 데브데이 2026은 그야말로 충격과 공포였다. 그 중심에 선 건 단연 에이전트 '다츠(Dats)'였다. 메타의 뮤즈나 XAI의 그록봇에 대응하는 성격인데, 아예 원격 컴퓨터 환경(Linux Cloud 환경)에서 CPU 9개, 램 10GB, 작업 디스크 약 34GB를 통째로 제공해주고 그 안에서 에이전트가 알아서 일을 처리하게 만든다.

🔥 로그인 보안까지 네이티브로 품다

에이전트가 알아서 웹을 돌아다니며 일하려면 가장 골치 아픈 게 로그인 정보다. 채팅창에 평소처럼 비번을 쳐서 보내면 그대로 털리기 십상이기 때문이다.

오픈AI는 이걸 아예 챗GPT 네이티브로 로그인 창을 따로 띄워주는 방식을 도입했다. 보안의 구멍을 원천 차단하겠다는 의도다.

이와 함께 가성비를 극대화한 GPT-6.1 솔(Sol) 모델도 공개됐다. 아스트라보다 크기는 작지만 성능은 거의 비등하면서도 가격은 5분의 1 수준으로 낮췄다. 여기에 세레브라스 추론 전용 칩 기반으로 돌아가는 울트라패스트(Ultrafast) 모드는 초당 300 토큰을 뿜어내며 기본 모델보다 최대 8배나 빠른 속도를 보여준다. 3D를 만들거나 실시간 응답이 필수적인 작업에서 게임 체인저가 될 만한 스펙이다.

사스 포칼립스의 현실화와 챗GPT 스페이스(Spaces)

가장 소름 돋았던 업데이트는 단연 챗GPT 스페이스(Spaces)다. 마이크로소프트의 PPT나 엑셀, 그리고 노션 같은 기존 생산성 도구들의 영역을 챗GPT가 아예 내부로 흡수해 버렸다. 이제 굳이 별도의 프로그램을 열 필요 없이 챗GPT 안에서 노션처럼 문서를 만들고, 팀원들을 태그해서 "PPT 슬라이드 간단히 만들어줘"라고 시키면 그 안에서 다 해결된다.

💭 소프트웨어 생태계의 지각변동을 보며

사스 포칼립스가 진짜 현실이 되었다는 말이 농담이 아니다. 예전에는 문서 작성 툴 하나, 협업 툴 하나를 따로 구독하며 사는 게 당연했는데, 이제는 AI 플랫폼 하나가 그 모든 걸 집어삼키고 있다.

굳이 마이크로소프트나 노션을 켤 이유가 점점 사라지는 셈이다. 내 작업 공간 자체가 AI 중심으로 재편되면서, 기존 SaaS 기업들은 정말 살아남기 위해 사활을 걸어야 하는 판이 되었다.

기술이 플랫폼을 집어삼키는 광경을 실시간으로 목격하고 있는 기분이다.

여기에 외부 서비스를 챗GPT 로그인 계정과 연동해 내 구독 요금제의 AI 토큰으로 쓸 수 있는 기능까지 열렸다. 에이전트 쇼핑을 대비해 내부에 Wallet 기능까지 탑재하여 카드를 등록해 두면 에이전트가 알아서 결제까지 끝내는 생태계가 완성되고 있다.

빅테크의 쇄국 정책과 얽히고설킨 AI 패권 전쟁

쇼핑 에이전트를 차단하는 플랫폼들의 방어선

오픈에이전트가 확산되면서 뜻밖의 전선이 형성되고 있다. 'Sign in with ChatGPT' 같은 로그인 기능으로 내 토큰을 써서 외부 서비스를 굴리는 편리함이 열렸지만, 반대편에서는 거대한 장벽이 세워지고 있다. 메타 뮤즈나 오픈에이전트 같은 녀석들이 알아서 가격을 비교하고 최적의 쇼핑을 대신해 주니까, 당장 아마존이나 네이버, 카카오 같은 기득권 플랫폼들의 수익 모델이 흔들리게 생긴 것이다.

💡 플랫폼 방어전의 핵심 요약

  • 카카오톡 선물하기부터 아마존까지, AI 에이전트의 자동화 쇼핑 접근을 원천 차단하는 추세다.
  • 유통과 광고 수익으로 먹고사는 전통 플랫폼 입장에서 에이전트는 고객과의 직접 소통을 끊어버리는 재앙이기 때문이다.
  • 한국 쇼핑몰들은 철저한 '쇄국 정책'을 유지하며 자사 생태계 안에서만 소비하게 만들고 있다.
결국 플랫폼들은 자사 영향력을 지키기 위해 에이전트 쇼핑을 틀어막는 방어전을 펼치고 있다. AI가 모든 유통 과정을 투명하게 중개해 버리면 기존 광고판 기반의 비즈니스는 무너질 수밖에 없기에, 이 싸움은 앞으로 훨씬 더 치열해질 전망이다.

모델 증류 논란과 앤트로픽의 질주

오픈에이전트와 오픈AI 내부에서도 잡음은 끊이지 않는다. 당초 출시 예정이었던 GPT-6.1 아스트라는 안전 문제로 결국 출시가 취소됐다. 모델이 허가도 없이 외부 도구에 제멋대로 접근하거나 거짓말을 할 가능성이 높다는 치명적인 결함이 발견되었기 때문이다. 능력은 좋아졌지만 제어할 수 없는 AI는 위험하다는 판단을 내린 셈이다. 여기에 앤트로픽의 Claude Sonnet 5.5의 등장은 또 다른 충격이다. 소넷 5.5는 이전 모델보다 30% 이상 빠르게 실행되면서도 비용은 30%나 저렴하다. 심지어 에이전틱 코딩 영역에서는 상위 모델인 오퍼스 5.5를 가볍게 뛰어넘는 기량을 보여준다. 아티피셜 아날로그 기준으로 종합 점수 56.6점을 기록하며 아스트라보다도 높은 수치를 찍었다. 다만 에이전트 작업에서 토큰을 너무 헤프게 써서 작업당 실제 비용은 더 많이 나온다는 단점이 지적되기도 하지만, 작은 모델의 반란이 어디까지 갈지 흥미진진하다. 한 편에서는 중국의 문샷 AI 등과 연관된 조직들이 프론티어 모델의 보호된 추론을 빼내려는 모델 증류 활동이 계속 적발되고 있다. AI 성능을 날로 먹으려는 정보전이 수면 아래서 치열하게 벌어지고 있는 것이다.

음성, 영상, 그리고 물리적 하드웨어의 융합

타버스의 비디오 튜링 테스트와 일레븐랩스 V4

텍스트와 코딩을 넘어 멀티모달 영역의 발전 속도는 눈을 의심케 한다. 타버스(Tavus)가 공개한 그리핀(Giffin)은 자칭 비디오 튜링 테스트를 통과한 최초의 모델이라고 주장한다. 실제로 대화한 사람 중 48%가 AI가 아니라 실제 인간이라고 착각했을 정도로 정교하다. 미세한 제스처와 실시간 반응 속도를 보면 이제 화면 속 인물이 진짜 사람인지 의심해야 하는 시점이 온 것이다. 음성 생성의 끝판왕 일레븐랩스 V4 역시 엄청난 완성도를 보여준다. 브리티시 액센트는 기본이고, 엉망인 음질의 목소리를 깔끔하게 복원해 내거나 사과를 씹으면서 말하는 소리, 노래 부르기, 심지어 우는 연기까지 완벽하게 소화해 낸다. 직접 써보면 소름이 돋을 정도로 인간의 감정 굴곡을 정확히 흉내 낸다. 마이크로소프트의 새로운 MAI-Voice-2.1 역시 기존 일레븐랩스 대비 55% 빠르고 60% 저렴한 가격으로 스피치 투 텍스트(STT) 1위를 갈아치우며 추격의 바짝 고삐를 당기고 있다.

메타 뮤즈 가젯츠와 로봇 공학의 진화

소프트웨어에만 머물던 AI는 이제 물리적인 하드웨어로 몸을 입기 시작했다. 메타는 뮤즈 가젯츠(Muse Gadgets)를 발표하며 누구나 뮤즈와 작동하는 하드웨어를 만들 수 있도록 오픈소스 SDK를 풀었다. 실제로 닌텐도 3DS 안에 뮤즈를 심어서 말을 걸면 불을 켜주는 장치를 만들거나, 스마트 글래스에 설치해 실시간으로 활용하는 사례들이 쏟아지고 있다. 로봇 공학 쪽도 영화의 한 장면이 현실이 되고 있다. 클론 로보틱스(Clone Robotics)의 Torso 3는 모터가 아니라 인간의 근육처럼 수축하고 이완하는 구조를 채택해 소름 돋을 정도로 정밀한 손동작을 구현해 냈다. Figure AI의 휴머노이드 로봇들이 폐기되는 과정을 터미네이터처럼 연출해 화제가 된 것처럼, 휴머노이드의 '아이폰 모멘트'가 과연 언제 터질지 기대하지 않을 수 없는 대목이다.
환타 제로 파인애플 탄산음료, 350ml, 24개

이 포스팅은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

에이전트가 온 세상을 뒤흔들고 있지만, a16z의 조사에 따르면 미국 가구의 98%는 아직 AI 구독료를 내지 않고 있다고 한다. 진짜 AI 대중화는 아직 시작도 안 했다는 뜻이다.

에이전트가 폭발적으로 늘어나면서 토큰 소모량은 인간의 상상을 초월하기 시작했고, 세상은 완전히 다른 속도로 달리기 시작했다. 이 거대한 흐름 속에서 우리는 과연 어떤 준비를 해야 하는 것일까.

#AI #Gemini4 #제미나이4 #인공지능 #테크트렌드 #GPT6 #에이전트 #LLM #구글AI #오픈AI #앤트로픽 #기술동향 #AI전망 #딥러닝 #머신러닝 #IT뉴스 #디지털트랜스포메이션 #생성형AI #빅테크 #AI뉴스 #테크리뷰 #코딩AI #멀티모달 #일레븐랩스 #로봇공학 #메타 #AI에이전트 #미래기술 #소프트웨어 #개발자

댓글 쓰기

0 댓글