로봇이 주변을 보고, 사용자의 말을 이해하고, 걸어서 물체를 옮기고, 손가락으로 섬세한 작업까지 수행하려면 단순한 동작 모방을 넘어선 지능이 필요합니다. Google DeepMind가 공개한 Gemini Robotics 2는 이 문제를 전신 제어, 장기 추론, 로컬 실행이라는 세 방향에서 풀어보려는 모델군입니다.

핵심은 로봇의 두뇌를 하나의 거대한 모델로 설명하지 않는다는 데 있습니다. 실제 동작을 담당하는 VLA, 여러 단계의 작업을 계획하는 체화 추론 모델, 네트워크 없이 로봇에서 실행되는 On-Device 모델을 나누고 서로 연결합니다.
Gemini Robotics 2 모델군의 세 가지 역할
Gemini Robotics 2는 시각과 언어 입력을 로봇의 모터 제어로 바꾸는 비전·언어·행동 모델입니다. 휴머노이드 전체와 양팔 로봇을 대상으로 하며, 이동과 조작을 하나의 작업 흐름으로 이어가는 것이 목표입니다.
Gemini Robotics ER 2는 고수준의 체화 추론을 맡습니다. 사용자의 지시를 해석하고 주변 공간을 이해한 뒤, 여러 단계로 이어지는 작업을 계획합니다. 실행 중 문제가 생기면 상황을 다시 살피고 다음 행동을 수정하며, 여러 로봇의 협업도 조율합니다.
Gemini Robotics On-Device 2는 로봇 장치 안에서 직접 실행하도록 최적화된 VLA입니다. 네트워크 연결이 불안정하거나 지연 시간이 중요한 환경에서 유리하며, 형태와 센서 구성이 다른 새 로봇에도 적은 양의 데이터로 적응하는 것을 지향합니다.
상체 제어에서 전신 작업으로
이전 세대의 로봇 AI가 책상 위 물체를 집고 옮기는 상체 작업에 집중했다면, 이번 모델은 걷기와 굽히기, 균형 잡기, 물체 조작을 함께 다룹니다. 예를 들어 로봇은 테이블까지 이동한 다음 물뿌리개를 집고, 선반으로 이동해 지정된 위치에 내려놓는 식의 작업을 수행할 수 있습니다.
손의 조작 능력도 강조됩니다. Apptronik Apollo 2의 다섯 손가락 손은 22개 자유도를 활용해 매듭을 묶거나 지퍼백을 밀봉하는 작업을 보여줍니다. Franka Duo처럼 두 손가락 그리퍼를 사용하는 로봇에서는 물건이 빽빽한 공간에서 포장하는 작업도 다룹니다. 다만 실제 현장에서 필요한 속도와 정밀도는 여전히 개선 과제로 남아 있습니다.
장기 추론과 로봇 협업

ER 2의 역할은 단순히 다음 버튼을 누르는 것이 아닙니다. 작업의 시작과 종료를 파악하고, 진행 상태를 추적하며, 단계가 실패했을 때 복구 경로를 선택해야 합니다. 이 구조가 안정화되면 한 대의 로봇이 모든 일을 맡기보다, 이동에 강한 로봇과 조작에 강한 로봇이 서로 작업을 넘기는 방식도 가능해집니다.
개발자 관점에서는 모델의 응답을 바로 모터에 연결하기보다 계획과 실행 사이에 안전 계층을 두는 것이 중요합니다. 예를 들어 고수준 모델이 도구 호출을 제안하면, 실행 전 권한·거리·사람의 접근 여부를 확인하고 위험도가 높을 때는 사람의 승인을 기다리는 식입니다.
plan = er_model.infer(scene, instruction)
for action in plan.actions:
if safety_gate.allows(action, scene):
vla.execute(action)
else:
request_human_confirmation(action)
로컬 실행과 빠른 적응이 주는 의미
On-Device 2는 인터넷 연결 없이 로봇에서 실행되는 상황을 전제로 합니다. 공장이나 물류 현장에서는 네트워크 지연이 작업 안전성과 직결될 수 있기 때문에, 인식과 기본 행동을 로컬에서 처리하는 구조가 중요합니다. 공개된 설명에 따르면 새로운 양팔 로봇의 형태·센서·자유도가 크게 달라도 200개 미만의 사례와 몇 시간의 적응 과정으로 적용할 수 있는 가능성을 보여줍니다.
물론 적은 데이터로 적응한다는 말이 곧바로 범용성을 보장하지는 않습니다. 새로운 하드웨어에서 실패하는 행동을 얼마나 빨리 감지하는지, 데이터가 부족한 작업에서 얼마나 보수적으로 멈추는지, 실제 환경의 조명과 장애물 변화에 얼마나 견디는지가 함께 검증되어야 합니다.
안전은 별도의 기능이 아니라 전체 구조
물리적 능력이 커질수록 모델의 성능 수치만으로는 충분하지 않습니다. Gemini Robotics 2는 전통적인 물리 안전 장치와 AI 안전 프레임워크를 결합하는 다층 접근을 강조합니다. 주변 사람을 감지하고, 사람이 너무 가까워지면 안전 동작을 호출하거나 로봇을 정지시키는 흐름이 대표적입니다.
특히 안전하지 않은 도구 호출을 거부하는지, 작업을 수행할 수 없을 때 불확실성을 인정하고 사람에게 개입을 요청하는지가 중요합니다. 로봇 AI에서는 성공률을 높이는 것만큼 위험한 성공을 막는 것이 제품 신뢰도를 좌우합니다.
개발자가 확인할 체크포인트
- 고수준 계획과 저수준 제어를 분리하고 각 단계의 실패를 기록하기
- 로컬 모델과 클라우드 모델의 역할 및 장애 시 대체 경로 정의하기
- 사람 접근, 속도, 힘, 도구 권한을 검사하는 안전 게이트 두기
- 새 하드웨어에 적응할 때 성공 사례뿐 아니라 실패 사례도 수집하기
- 단일 로봇의 데모보다 여러 단계 작업과 반복 실행의 안정성을 측정하기
정리
Gemini Robotics 2의 의미는 로봇에게 더 많은 행동을 시키는 데만 있지 않습니다. 전신을 움직이는 VLA, 장기 작업을 계획하는 ER 모델, 장치 안에서 실행되는 On-Device 모델을 조합해 로봇의 인식·추론·행동을 하나의 시스템으로 묶으려는 시도입니다. 앞으로의 관건은 데모의 인상적인 동작보다 낯선 환경에서의 일반화, 지연과 비용, 그리고 위험한 순간에 멈출 수 있는 안전성입니다.
📰 원본 출처 · https://news.hada.io/topic?id=31997 (#N=31997)
이 글은 GeekNews(긱뉴스)에 게제된 글을 기반으로 작성되었습니다. 원본의 라이선스와 저작권은 원작자에게 있습니다.
'AI 뉴스' 카테고리의 다른 글
| Kimi K3 로컬 실행 가이드 — 2.8T 파라미터 오픈 웨이트 모델을 Unsloth GGUF로 돌리는 법 (0) | 2026.07.31 |
|---|---|
| TV 스트리밍 스틱 구매 가이드 — HDMI/Wi-Fi/리모컨 5가지 체크리스트 (0) | 2026.07.31 |
| AI 미학 — ✨·반짝이는 텍스트·작은 아이콘이 만드는 새로운 소프트웨어 관용구 (0) | 2026.07.31 |
| GPT-5.6, 가격 대비 성능의 한계를 확장 — 모델 카탈로그 재편 신호 (0) | 2026.07.31 |
| AI 기업들의 전기기사·목수 수천 명 채용 — 데이터센터 인프라 인력 부족의 현실 (0) | 2026.07.31 |