공간생물학에서 맥락은 실험이 끝난 뒤 덧붙이는 metadata가 아니다. 맥락 자체가 측정의 일부다.
같은 폐암 조직 두 장을 공간전사체로 분석했다고 가정해 보자. 한 조직은 치료 전 원발성 종양에서, 다른 조직은 여러 치료를 거친 뒤 전이 병변에서 채취되었다. 기술적으로는 동일한 유전자와 세포를 측정했더라도 두 결과가 의미하는 바는 전혀 다를 수 있다.
그런데 실제 데이터에서는 이러한 차이가 ‘샘플 정보’라는 작은 표 안에 남거나, 때로는 아예 누락된다. 세포 수는 늘어났지만 그 세포가 어떤 환자의 어떤 임상적 순간을 반영하는지 알 수 없다면, 데이터의 크기와 해석 가능성은 함께 증가하지 않는다.
공간전사체의 핵심 희소 자원은 장비만이 아니다. 적절한 조직과 그 조직을 설명하는 임상적 맥락이다.
큰 데이터셋이 반드시 좋은 데이터셋은 아니다
데이터셋의 규모는 흔히 환자 수, 조직 수 또는 세포 수로 표현된다. 이 수치는 처리량을 보여주지만 데이터의 대표성이나 신약개발 적합성을 보장하지는 않는다.
같은 암종 안에서도 병기, 조직학적 아형, 치료 이력, 인종적 배경, 채취 부위에 따라 생물학이 달라진다. 원발성 종양과 전이 병변도 다르며, 전이된 장기에 따라 종양미세환경이 달라질 수 있다. 수술 검체와 생검 검체, 신선동결 조직과 포르말린 고정 파라핀 포매 조직 사이에도 전처리와 품질의 차이가 존재한다.
따라서 천 명의 환자를 포함한 데이터라도 제한된 적응증, 제한된 의료적 상황에 편중되어 있다면 적용 범위는 제한적이다. 반대로 수십 명의 환자만 포함했더라도 임상 질문에 맞게 정교하게 설계된 cohort라면 중요한 의사결정에 더 유용할 수 있다.
문제의 표면에는 조직 확보의 어려움이 있다. 그 아래에는 환자 동의 범위, 병리 품질, 임상정보와 조직의 연결, 기관별 보관 방식, 전처리 시간 및 데이터 사용 권한이 복합적으로 얽혀 있다. 결국 tissue bottleneck은 물량 부족이 아니다. 사용할 수 있고, 설명할 수 있으며, 비교할 수 있는 조직의 부족에 가깝다.
Tumor-only로는 therapeutic window를 보기 어렵다
신약 표적을 평가할 때 종양에서 발현이 높다는 사실만으로는 충분하지 않다. 정상조직에서의 발현과 위치를 함께 보아야 약효와 독성 사이의 범위, 즉 therapeutic window를 추정할 수 있다.
Tumor-only dataset은 종양 내 이질성과 미세환경을 이해하는 데 유용하지만, 표적이 신장·간·심장·소화기관과 같은 정상장기의 어떤 세포에 존재하는지는 알려주지 못한다. 인접 정상조직 역시 유용하지만 염증이나 field effect의 영향을 받을 수 있어 건강한 정상장기를 완전히 대신하지는 못한다.
이 때문에 tumor와 normal data 를 동시에 구축해야 한다. 이상적으로는 동일 환자의 종양과 정상조직을 연결하여야 하지만, 목적에 따라 독립적인 정상장기 reference와 비교할 수는 있어야 한다. 모든 암종에서 완벽한 matched sample을 확보하는 것은 현실적으로 어렵기 때문에, 어떤 정상조직이 해당 치료 modality의 핵심 독성기관인지 우선순위를 정하는 접근이 필요하다.
표준화와 다양성 사이의 균형
단일 기관 cohort는 병리 판독과 임상정보, 조직 처리 방식이 비교적 일관적이라는 장점이 있다. 그러나 특정 지역이나 환자군에 편중될 수 있다. 다기관 cohort는 일반화 가능성을 높이는 대신, 서로 다른 수술·보관·전처리 과정에서 발생하는 변이를 감수해야 한다.
해결책은 모든 조직을 하나의 방식으로 강제하는 것이 아니다.
단기적으로는 연구 목적에 따라 cohort를 먼저 설계하고(외부 링크: link.portrai.io 또는 Cohortlab 설명 페이지), 병기·치료 이력·채취 부위·원발성 또는 전이성 여부 등 최소 임상 metadata를 정의해야 한다. 병리 QC와 분석 QC도 분리하지 말고, 조직 상태가 데이터 품질에 미친 영향을 함께 기록해야 한다.
중기적으로는 주요 적응증에 대해 tumor-normal reference를 구축하고, 여러 지역과 기관의 데이터를 단계적으로 확장해야 한다. 장기적으로는 병원과 데이터 기업, 제약회사가 일회성 검체 구매가 아닌 지속적인 데이터 파트너십을 형성해야 한다. 조직과 임상 결과가 시간이 지나며 연결될 때 데이터의 가치는 누적된다.
다만 희귀암이나 치료 전후 longitudinal sample처럼 본질적으로 구하기 어려운 조직에서는 대규모 표준화를 요구하는 것이 오히려 중요한 데이터를 배제할 수 있다. 이런 경우에는 규모보다 샘플의 희소성, 임상적 깊이와 추적 가능성을 평가해야 한다.
Portrai가 얻은 학습
Portrai가 여러 암종의 인간 유래 공간 데이터를 구축하며 배운 점은, 데이터의 가치를 세포 수만으로 설명하기 어렵다는 것이다. 표적의 발현은 어떤 환자와 부위에서 측정했는지, 치료 전후 중 어느 시점인지, 암세포와 정상세포 중 어디에 위치하는지에 따라 의미가 달라졌다.
특히 ADC, RPT, TCE와 같은 modality에서는 종양 내 발현량뿐 아니라 정상장기 발현, 환자 간 일관성, 주변 세포와의 거리까지 함께 보아야 했다. 이 경험은 데이터 규모 경쟁보다 ‘어떤 결정에 사용할 cohort인가’를 먼저 질문하게 한다.
앞으로 5년
낙관적으로는 다지역·다인종 spatial cohort가 임상 결과와 연결되면서 표적과 바이오마커의 일반화 가능성을 더 일찍 평가하게 될 것이다. 현실적으로는 주요 암종과 고가치 신약 modality부터 목적형 cohort가 축적될 가능성이 높다.
반대로 임상 맥락 없이 대규모 데이터만 생산된다면, 향후 AI 모델은 기술적으로 정교하지만 실제 환자군을 충분히 대표하지 못할 수 있다. 좋은 모델은 큰 데이터뿐 아니라 그 데이터가 누구에게서, 언제, 왜 만들어졌는지를 필요로 한다.
In spatial biology, context is not metadata added after the experiment. Context is part of the measurement itself.
그러나 고품질 조직을 확보하는 것만으로는 충분하지 않다. 제한된 임상 샘플을 일관된 품질로 대규모 처리하려면, 다음 병목인 실험의 표준화와 자동화를 해결해야 한다.










