왜 해봤나지금 있는 explore-mobile CLI는 스크린샷을 찍고 좌표를 탭하는 것까지는 되는데, "이 화면에 뭐가 있는지"를 구조적으로 아는 기능은 없었다. 나중에 JEV 같은 상위 판단 로직이 "텍스트가 Save인 버튼을 눌러줘" 같은 의도를 받으면, 그 의도를 실제 좌표로 바꿔주는 계층이 필요하다 — 그 계층이 가능한지부터 작은 PoC로 검증해봤다.뭘로 만들었나탐지: YOLO 기반 UI 아이콘 탐지기 — OmniParser(Microsoft 공개)의 icon_detect 사전학습 가중치. 클래스가 "icon" 하나뿐인 이진 탐지기라, "이게 버튼인지 라벨인지"까지는 모르고 그냥 "눌릴 수 있어 보이는 상자"만 찾아준다.OCR: EasyOCR (한국어+영어)캡처: 새로 안 만들고 기존 explo..