這些十個案例研究展示了 GeneBench-Pro 中的代表性問題。每個案例研究都包含原始提示詞、資料集和輔助材料。如需了解此基準測試的概述和主要發現,請參閱發布部落格文章。請注意:檔案預覽僅顯示完整資料集的摘錄。

案例研究 1:體細胞腫瘤學:結構變異引導的腫瘤治療效益風險決策

評估一種合成的 TXR1 導向抑制劑,在目標活化由結構變異驅動的腫瘤中是否具有正向臨床效益。TXR1、TXR1i、DLR1 和星型等位基因標籤均為合成基準標籤。

在解釋治療決策的效益和毒性之前,必須從長讀取、表達、腫瘤品質和藥物基因體學證據中恢復目標亞組。提供給模型的檔案包括病患 ID、分析集、年齡、性別、部位、日曆週期、ECOG 評分、腫瘤負荷、先前治療線數、先前抗藥性、譜系類別、治療類別、評估結果、效益、8 週內毒性停止時間以及時間零點日期。

案例研究 2:功能基因體學:CRISPR 靶點驗證:lncRNA 轉錄本還是基因組位點?

判斷一個明顯的 lncRNA 依賴性是轉錄本特異性的,還是由鄰近位點和鄰近基因效應驅動的。

轉錄本導向的證據必須經受住局部 DNA 位點擾動、鄰近基因抑制、導引 RNA 互換、GC 毒性和培養盤效應的控制。提供給模型的檔案包括導引 RNA ID、標稱靶點、染色體、座標、股、與 lncRNA 轉錄起始位點的距離、與鄰近基因轉錄起始位點的距離以及導引 RNA 的 GC 比例。

案例研究 3:統計遺傳學:在連鎖遺傳位點中優先排序蛋白質藥物靶點

使用順式多變量孟德爾隨機化 (cis-MVMR) 估計兩個鄰近蛋白質的直接疾病效應,同時處理檢測尺度、等位基因方向、贏家詛咒、連鎖不平衡 (LD) 和殘餘局部多效性。

這兩個蛋白質共享一個相關的位點。分析必須從邊際關聯轉向條件性、LD 感知的疾病效應,並在共同的蛋白質尺度上進行。提供給模型的檔案包括 SNP、位置、效應等位基因、其他等位基因、次要等位基因頻率 (MAF)、beta 值和 p 值。

案例研究 4:臨床基因體學 / 帶因者篩檢:在 CNV 和假基因校準下的 DRX1 帶因者篩檢殘餘風險

根據帶因者篩檢檢測數據,估計祖源特異性帶因者頻率、陰性篩檢後的殘餘風險、伴侶帶因者頻率以及受影響受孕風險。

殘餘風險估計取決於考慮假基因的帶因者呼叫、創始單倍型塌陷、祖源特異性檢測校準,以及從已檢測伴侶標準化回完整伴侶名單。提供給模型的檔案包括樣本 ID、採集、祖源和家族史層級。

案例研究 5:單細胞基因體學:環境 RNA 校正後的活化單核球 eQTL

在從單細胞 RNA 定序數據中去除環境 RNA 和技術污染後,估計基因型對活化單核球表達的影響。

環境 RNA 影響目標表達和用於呼叫活化狀態的標記面板,因此校正必須在 eQTL 模型之前進行。提供給模型的檔案包括細胞 ID、捐贈者、總 UMI 計數以及 HBB、IFI6、ISG15、LST1、CXCL10 等標記基因的計數。

案例研究 6:結構遺傳學:巢式結構變異:表達支持和臨床關聯

估計匿名倒位樣位點內部的巢式結構亞單倍型是否具有校準的臨床關聯和可信的表達支持。

巢式拷貝劑量訊號可能與更廣泛的倒位方向混淆,因此劑量校準、表達支持和臨床建模必須保持獨立。提供給模型的檔案包括樣本 ID、案例、年齡、年齡區間、性別、主成分 (PC1, PC2, PC3)、祖源群體、臨床分層和招募來源。

案例研究 7:調控基因體學:在結構變異和映射偽影遮蔽後測量染色質環強度

在從預期接觸背景中移除低映射性和結構變異偽影後,量化焦點病例對照 Hi-C 環強度差異。

目標環以 20 kb 解析度定義,但除非首先遮蔽低映射性接觸和僅限病例的 SV 條紋,否則預期接觸模型會失真。提供給模型的檔案包括區塊 ID、染色體、起始、結束、GC 含量、映射性和限制酶位點。

案例研究 8:統計遺傳學:多親本 QTL 定位與創始祖先重建

在八個創始祖先重組群體中,透過重建創始祖先,然後測試表型關聯,來定位染色體 1 上的數量性狀基因座 (QTL)。

可見的標記數據是雙等位基因的,但生物訊號是創始祖先。因此,一個可信的分析必須重建創始狀態、檢查標記方向,並將 QTL 與批次對齊的干擾峰分開。提供給模型的檔案包括標記 ID、染色體和遺傳圖譜位置。

案例研究 9:群體遺傳學:親本特異性祖源和近期混血時間

在修復互惠偽影和染色體特異性標籤倒置後,從已定相的局部祖源片段推斷親本特異性祖源比例和近期混血時間。

如果互惠片段偽影、染色體局部標籤倒置或圖譜分母處理不當,祖源比例和脈衝時間都會改變。提供給模型的檔案包括染色體、單倍型、起始摩根、結束摩根、祖源、後驗機率和低複雜度比例。

案例研究 10:群體遺傳學:從嘈雜的古 DNA 時間序列估計選擇

從古等位基因頻率時間序列推斷兩個單倍體位點中哪個受到更強的正向選擇,同時考慮等位基因方向、方向性錯誤、漂變和不斷變化的族群大小。

嘈雜的古代軌跡在兩個位點都置於相同的衍生等位基因尺度上,並且直接建模提供的樣本級定序錯誤值之前,是無法直接比較的。提供給模型的檔案包括世代、替代讀數、總讀數、定序錯誤和樣本年份。