서비스 핫라인
Google DeepMind는 로봇이 "이제까지 없었던 더 광범위한 실제 작업을 수행"하도록 돕기 위해 설계된 두 가지 새로운 인공 지능 모델을 출시합니다. 첫 번째 모델은 제미니 로보틱스,는 사전 훈련 없이도 새로운 상황을 이해할 수 있는 시각-언어-행동 모델입니다.
![]()
Gemini Robotics는 다음을 기반으로 구축되었습니다. 쌍둥이 자리 2.0, Google의 주력 인공지능 모델의 최신 버전입니다. 기자 회견에서 Google DeepMind의 수석 이사이자 로보틱스 책임자인 Carolina Parada는 Gemini Robotics가 "Gemini의 멀티모달 세계에 대한 이해를 활용하여 새로운 모달리티로 물리적 행동을 추가하여 실제 세계로 전환합니다."라고 말했습니다.
새로운 모델은 Google DeepMind가 유용한 로봇을 만드는 데 중요하다고 생각하는 세 가지 핵심 영역에서 진전을 이루었습니다. 일반화, 상호작용성 및 손재주. 새로운 시나리오를 일반화하는 능력 외에도 Gemini Robotics는 사람과 환경과 더 잘 상호 작용할 수 있습니다. 또한 종이를 접거나 병 뚜껑을 제거하는 것과 같은 더 정확한 물리적 작업을 수행할 수도 있습니다.
구글 딥마인드의 새로운 제미니 로보틱스 모델은 로봇을 더욱 능숙하게 만듭니다.
파라다는 "과거에는 이 세 가지 영역에서 개별적으로 진전을 이루었지만, 이제는 단일 모델로 세 가지 영역 모두에서 성과를 크게 개선하고 있습니다. 이를 통해 환경 변화에 더 유능하고 반응성이 뛰어나며 견고한 로봇을 만들 수 있습니다."라고 말했습니다.
구글 딥마인드도 소개 제미니 로보틱스-ER (Embodied Reasoning)은 회사에서 "복잡하고 끊임없이 변화하는 세상을 이해할 수 있는" 고급 비전 언어 모델이라고 설명합니다.
Parada가 설명했듯이, 여러분 앞에 있는 테이블에 다양한 품목이 담긴 도시락을 챙길 때, 여러분은 모든 것이 어디에 있는지, 도시락을 어떻게 여는지, 어떻게 품목을 집어 올리는지, 어디에 두는지 알아야 합니다. 이것이 바로 Gemini Robotics-ER이 처리하도록 설계된 추론의 종류입니다. 로봇 전문가가 기존의 저수준 컨트롤러(로봇의 움직임을 제어하는 시스템)와 연결하여 Gemini Robotics-ER이 제공하는 새로운 기능을 사용할 수 있도록 하는 것을 목표로 합니다.
제미니 로보틱스는 로봇이 다양한 작업을 수행하도록 지원할 수도 있습니다.
안전과 관련하여 Google DeepMind의 연구원인 Vikas Sindhwani는 기자들에게 회사가 "계층적 접근 방식"을 개발 중이라고 말했고 Gemini Robotics-ER 모델은 "특정 시나리오에서 잠재적인 행동을 실행하는 것이 안전한지 평가하도록 훈련되었습니다."라고 덧붙였습니다. 이 회사는 또한 AI 산업이 안전 연구를 더욱 발전시키는 데 도움이 되는 새로운 벤치마크와 프레임워크를 발표했습니다. 작년에 Google DeepMind는 Isaac Asimov에서 영감을 받은 로봇 규칙 세트인 "Robot Constitution"을 도입했습니다.
Google DeepMind는 Apptronik과 협력하여 "차세대 휴머노이드 로봇을 구축"하고 있습니다. 또한 Google DeepMind는 Agile Robots, Agility Robotics, Boston Dynamics, Enchanted Tools를 포함하여 Gemini Robotics-ER 모델에 대한 "신뢰할 수 있는 테스터" 액세스를 허용하고 있습니다. Parada는 "우리는 물리적 세계를 이해하고 그 안에서 조치를 취할 수 있는 지능을 구축하는 데 매우 집중하고 있습니다. 이를 여러 구현과 애플리케이션에 활용하게 되어 매우 기쁩니다."라고 말했습니다.




粤公网安备44030002007346号