SPATIO-TEMPORAL VISION-LANGUAGE MODEL

Pixel Y ST-VLM

픽셀와이가 독자적으로 설계하는시공간 비전-언어 모델

장면과 장면사이를 읽습니다

에스컬레이터 위의 8초 · 설계 예시

보류 00:05.6 – 00:06.8
PIXEL Y ST-VLM

공개 기반 위에,학습 가능한 자체 코어를 쌓습니다

공개 모델을 활용하는 부분과 픽셀와이가 직접 개발·학습하는 부분을 나누고, 그 차이를 재현 가능한 비교로 보여 줍니다.

입력 · 공개 기반 구성요소

영상
포즈 · 동작
“이 캐리어는 누구의 것인가?”언어 질문
Pixel Y ST-VLM자체 코어 · 신규 R&D
  1. 01포즈–영상 융합신규 R&D · CareBridge 기반
  2. 02시간적 행동·상태 표현신규 R&D
  3. 03근거·불확실성·보류신규 R&D

제품화 가설

행동 · 상태 · 근거
산업별 엔진 · API
고객 시스템
평가 설계 · 같은 영상, 같은 기준

A기반 VLM·B같은 데이터로 추가 학습·C포즈 정보 단순 결합·DPixel Y 제안 구조

스튜디오에서 수어를 하는 사람의 영상 위에 몸·손·얼굴 키포인트가 표시된 화면. 얼굴은 흐리게 처리됨 CareBridge 수어 영상 · 포즈 추정
MODULE 01

포즈–영상 융합

포즈 추정의 품질과 영상의 시각 맥락을 함께 쓰는 학습형 융합을 연구합니다. CareBridge에서 포즈 인코더와 VLM을 결합해 본 경험에서 출발합니다.

신규 R&D · CareBridge 기반
설계 예시
MODULE 02

시간적 행동·상태 표현

한 장면이 아니라 앞뒤 장면을 이어서, 행동의 순서와 사람–사물 관계, 전후 상태 변화를 유지하는 표현을 연구합니다.

신규 R&D
설계 예시
MODULE 03

근거·불확실성·보류

답마다 시간과 객체 근거를 남기고, 확인할 수 없는 구간은 판단을 보류하도록 설계합니다. 최종 결정은 사람이 내립니다.

신규 R&D

먼저 검증할 현장

콘셉트 이미지
선행 개발·시연

에스컬레이터 안전

승객·캐리어·손잡이의 관계를 시간 순서로 읽는 시제품

콘셉트 이미지
PoC 준비

제조 · 물류

저장된 작업 영상을 행동·순서·상태 변화의 검토 기록으로 바꿉니다. 최종 판단은 담당자가 합니다.

CAREBRIDGE · 선행 구현

먼저, 수어를 읽었습니다

스마트폰 카메라로 한국수어를 읽고, 아바타로 답하는 앱

88.58% 수어 완전 일치율 · 16프레임 CareBridge 스튜디오 수어 검증셋 19,677건 자체평가 · 8프레임 85.87%
CareBridge 홈페이지
ROADMAP

산업 현장 검증 후환경과 Physical AI로 확장합니다

Pixel Y ST-VLM
지금 · PoC 준비산업 현장저장된 작업 영상의 사후 검토
다음 · 후속 확장환경행동·상태 변화 이해로 확장
장기 방향Physical AI로봇·자동화 시스템의 인지 계층으로 연동

함께 검증할파트너를 찾습니다

현장 영상으로 10주 PoC를 함께 설계합니다.