기본 콘텐츠로 건너뛰기

라벨이 Gemini 3.5 Flash인 게시물 표시

코드를 '쓰는' AI에서 '실행하는' 에이전트로: Google Antigravity와 Gemini 3.5 Flash가 여는 에이전트 개발 시대

2026년 7월 현재, 구글(Google)의 기술 트렌드를 관통하는 단 하나의 키워드를 꼽으라면 단연 **'에이전트(Agent)'**입니다. 지난 5월 Google I/O 2026에서 공개된 Gemini 3.5 Flash , 에이전트 우선 개발 플랫폼 Antigravity 2.0 , 그리고 영상 기반 생성 모델 Gemini Omni 까지 — 구글이 던진 메시지는 명확합니다. AI는 이제 코드를 '거들어 쓰는' 부조종사(Co-pilot)를 넘어, 스스로 작업을 '실행하는' 자율 에이전트로 이동하고 있습니다. 이번 글에서는 개발자와 기술 실무자의 관점에서, 구글이 최근 발표한 핵심 기술들이 실제 개발 워크플로우를 어떻게 바꾸고 있는지 근거와 함께 정리합니다. 1. Gemini 3.5 Flash: '싸고 빠른' 티어가 이전 플래그십을 넘어섰다 이번 발표에서 가장 상징적인 사건은 저가·고속 티어인 Gemini 3.5 Flash가 이전 플래그십 모델인 Gemini 3.1 Pro를 코딩·에이전트 벤치마크에서 앞질렀다 는 점입니다. 구글은 이를 "행동하는 프런티어 지능(frontier intelligence with action)"이라고 표현했습니다. 공개된 벤치마크 수치는 다음과 같습니다. Terminal-Bench 2.1: 76.2% — 터미널 환경에서의 실제 코딩 수행 능력 GDPval-AA: 1656 Elo — 실무형 에이전트 태스크 수행 능력 MCP Atlas: 83.6% — 도구 호출(tool-use) 및 MCP 연동 성능 핵심은 단순히 점수가 높다는 것이 아니라 **"다른 프런티어 모델 대비 약 4배 빠른 속도로, 절반 이하의 비용"**에 이 성능을 낸다는 점입니다. 에이전트는 하나의 작업을 완수하기 위해 수십~수백 번의 추론·도구 호출을 반복합니다. 따라서 '속도 × 비용'은 에이전트 워크플로우의 실용성을 결정하는 절대적 변수...

[AI 꿀팁] Gemini 3.5 Flash vs 3.1 Pro, 내 토큰이 순식간에 녹아내린 이유와 똑똑한 모델 선택 가이드

[AI 꿀팁] Gemini 3.5 Flash vs 3.1 Pro, 내 토큰이 순식간에 녹아내린 이유와 똑똑한 모델 선택 가이드 안녕하세요! 최근 구글의 차세대 AI 라인업인 Gemini 3.5 Flash 와 Gemini 3.1 Pro 를 사용해 보시면서 "어? 왜 이렇게 토큰(비용)이 순식간에 사라지지?" 하고 당황하셨던 분들 많으실 겁니다. 질문 몇 개 안 한 것 같은데 토큰 제한이 걸리거나 비용이 청구되는 눈물 나는 상황... 도대체 왜 이런 일이 발생하는지, 그리고 내 지갑을 지키면서 AI 효율을 극대화하는 모델 및 옵션 선택 기준 을 총정리해 드립니다! 1. 내 토큰은 어디로 사라졌을까? 범인은 'Thinking 모드' 구글 Gemini 3.x 라인업의 가장 강력한 무기는 바로 '내장형 고도화 추론(Thinking) 기능'입니다. AI가 정답을 내기 전에 내부적으로 깊게 고민하는 단계를 거치는 것인데요. 여기서 반전이 있습니다. AI가 내부적으로 머리를 굴리며 쓴 혼잣말(추론 토큰)이 모두 '출력(Output) 토큰 사용량'에 포함되어 계산 된다는 점입니다! Thinking (High) 모드의 무서움: 사용자가 질문을 한 줄만 던졌어도, AI는 완벽한 정답을 내기 위해 백그라운드에서 스스로 에이전트 루프를 돌리며 수만 토큰을 써버립니다. 겉보기엔 짧은 답변이라도 실제로는 엄청난 토큰이 소모되는 주범이죠. 늘어난 출력 창: Gemini 3.5 Flash는 한 번에 뿜어낼 수 있는 출력 한도가 65,536 토큰 으로 대폭 늘어났습니다. 모델이 글을 길게 쓰거나 깊게 생각하기 시작하면 한 번의 대화로도 토큰이 텅텅 비게 됩니다. 2. Gemini 모델별 'Thinking 레벨'에 따른 토큰 소모량 비교 모든 모델의 최대 입력은 100만 토큰, 최대 출력은 65,536 토큰으로 동일하지만, Thinking 설정에 따라 내부 토큰 배분이 완전히 달라집니다. ...

[AI 꿀팁] Gemini 3.5 Flash vs 3.1 Pro, 내 토큰이 순식간에 녹아내린 이유와 똑똑한 모델 선택 가이드

[AI 꿀팁] Gemini 3.5 Flash vs 3.1 Pro, 내 토큰이 순식간에 녹아내린 이유와 똑똑한 모델 선택 가이드 안녕하세요! 최근 구글의 차세대 AI 라인업인 Gemini 3.5 Flash 와 Gemini 3.1 Pro 를 사용해 보시면서 "어? 왜 이렇게 토큰(비용)이 순식간에 사라지지?" 하고 당황하셨던 분들 많으실 겁니다. 질문 몇 개 안 한 것 같은데 토큰 제한이 걸리거나 비용이 청구되는 눈물 나는 상황... 도대체 왜 이런 일이 발생하는지, 그리고 내 지갑을 지키면서 AI 효율을 극대화하는 모델 및 옵션 선택 기준 을 총정리해 드립니다! 1. 내 토큰은 어디로 사라졌을까? 범인은 'Thinking 모드' 구글 Gemini 3.x 라인업의 가장 강력한 무기는 바로 '내장형 고도화 추론(Thinking) 기능'입니다. AI가 정답을 내기 전에 내부적으로 깊게 고민하는 단계를 거치는 것인데요. 여기서 반전이 있습니다. AI가 내부적으로 머리를 굴리며 쓴 혼잣말(추론 토큰)이 모두 '출력(Output) 토큰 사용량'에 포함되어 계산 된다는 점입니다! Thinking (High) 모드의 무서움: 사용자가 질문을 한 줄만 던졌어도, AI는 완벽한 정답을 내기 위해 백그라운드에서 스스로 에이전트 루프를 돌리며 수만 토큰을 써버립니다. 겉보기엔 짧은 답변이라도 실제로는 엄청난 토큰이 소모되는 주범이죠. 늘어난 출력 창: Gemini 3.5 Flash는 한 번에 뿜어낼 수 있는 출력 한도가 65,536 토큰 으로 대폭 늘어났습니다. 모델이 글을 길게 쓰거나 깊게 생각하기 시작하면 한 번의 대화로도 토큰이 텅텅 비게 됩니다. 2. Gemini 모델별 'Thinking 레벨'에 따른 토큰 소모량 비교 모든 모델의 최대 입력은 100만 토큰, 최대 출력은 65,536 토큰으로 동일하지만, Thinking 설정에 따라 내부 토큰 배분이 완전히 달라집니다. ...