作者herborthu (herborthu)
看板BioMedInfo
标题[问题] 请问为什麽这一题要分a,b两类?
时间Wed Sep 16 22:02:02 2009
2000网易杯全国大学生数学建模
DNA序列分类
2000年6月,人类基因组计画中DNA全序列草图完成,预计2001年可以完成精确的全序
列图,此后人类将拥有一本记录着自身生老病死及遗传进化的全部讯息的“天书”。
这本大自然写成的“天书”是由4个字符A,T,C,G按一定顺序排成的长约30亿的序列,
其中没有“断句”也没有标点符号,除了这4个字符表示4种硷基以外,人们对它包含
的“内容”知之甚少,难以读懂。破译这部世界上最巨量讯息的“天书”是二十一世纪
最重要的任务之一。在这个目标中,研究DNA全序列具有什麽架构,由这4个字符排成的
看似随机的序列中隐藏着什麽规律,又是解读这部天书的基础,是最重要的课题之一。
虽然人类对这部“天书”知之甚少,但也发现了DNA序列中的一些规律性和架构。例如,在全序列中有一些是用于编码蛋白质的序列片段,即由这4个字符组成的64种不同的3字元串,其中大多数用于编码构成蛋白质的20种氨基酸。又例如,在不用于编码蛋白质的序列片段中,A和T的含量特别多些,于是以某些硷基特别丰富作为特徵去研究DNA序列的架构也取得了一些结果。此外,利用统计的方法还发现序列的某些片段之间具有相关性,等等。这些发现让人们相信,DNA序列中存在着局部的和全局性的架构,充分发掘序列的架构对理解DNA全序列是十分有意义的。目前在这项研究
中最普通的思想是省略序列的某些细节,突出特徵,然後将其表示成适当的数学对象。这
种被称为粗粒化和模型化的方法往往有助于研究规律性和架构。
作为研究DNA序列的架构的尝试,提出以下对序列集合进行分类的问题︰
1)下面有20个已知类别的人工制造的序列(见下页),其中序列标号1─10 为A类
,11-20为B类。请从中提取特徵,构造分类方法,并用这些已知类别的序列,衡量你的
方法是否足够好。然後用你认为满意的方法,对另外20个未标明类别的人工序列
(标号21─40)进行分类,把结果用序号(按从小到大的顺序)标明它们的类别
(无法分类的不写入)︰B类 。
请详细描述你的方法,给出计算程式。如果你部分地使用了现成的分类方法,也要
将方法名称准确注明。
这40个序列也放在如下位址的网页上,用数据文件Art-model-data 标识,供下载︰
网易网址︰www.163.com 教育频道 在线试题;
教育网︰ www.cbi.pku.edu.cn News mcm2000
教育网︰ www.csiam.edu.cn/mcm
2)在同样网址的数据文件Nat-model-data 中给出了182个自然DNA序列,
它们都较长。用你的分类方法对它们进行分类,像1)一样地给出分类结果。
提示︰衡量分类方法优劣的标准是分类的正确率,构造分类方法有许多途径,
例如提取序列的某些特徵,给出它们的数学表示︰几何空间或向量空间的元素
等,然後再选择或构造适合这种数学表示的分类方法;又例如构造机率统计模
型,然後用统计方法分类等。
Art-model-data
1.aggcacggaaaaacgggaataacggaggaggacttggcacggcattacacggaggacgaggtaaaggaggcttgtctacggccggaagtgaagggggatatgaccgcttgg
2.cggaggacaaacgggatggcggtattggaggtggcggactgttcggggaattattcggtttaaacgggacaaggaaggcggctggaacaaccggacggtggcagcaaagga
3.gggacggatacggattctggccacggacggaaaggaggacacggcggacatacacggcggcaacggacggaacggaggaaggagggcggcaatcggtacggaggcggcgga
4.atggataacggaaacaaaccagacaaacttcggtagaaatacagaagcttagatgcatatgttttttaaataaaatttgtattattatggtatcataaaaaaaggttgcga
5.cggctggcggacaacggactggcggattccaaaaacggaggaggcggacggaggctacaccaccgtttcggcggaaaggcggagggctggcaggaggctcattacggggag
6.atggaaaattttcggaaaggcggcaggcaggaggcaaaggcggaaaggaaggaaacggcggatatttcggaagtggatattaggagggcggaataaaggaacggcggcaca
7.atgggattattgaatggcggaggaagatccggaataaaatatggcggaaagaacttgttttcggaaatggaaaaaggactaggaatcggcggcaggaaggatatggaggcg
8.atggccgatcggcttaggctggaaggaacaaataggcggaattaaggaaggcgttctcgcttttcgacaaggaggcggaccataggaggcggattaggaacggttatgagg
9.atggcggaaaaaggaaatgtttggcatcggcgggctccggcaactggaggttcggccatggaggcgaaaatcgtgggcggcggcagcgctggccggagtttgaggagcgcg
10.tggccgcggaggggcccgtcgggcgcggatttctacaagggcttcctgttaaggaggtggcatccaggcgtcgcacgctcggcgcggcaggaggcacgcgggaaaaaacg
11.gttagatttaacgttttttatggaatttatggaattataaatttaaaaatttatattttttaggtaagtaatccaacgtttttattactttttaaaattaaatatttatt
12.gtttaattactttatcatttaatttaggttttaattttaaatttaatttaggtaagatgaatttggttttttttaaggtagttatttaattatcgttaaggaaagttaaa
13.gtattacaggcagaccttatttaggttattattattatttggattttttttttttttttttttaagttaaccgaattattttctttaaagacgttacttaatgtcaatgc
14.gttagtcttttttagattaaattattagattatgcagtttttttacataagaaaatttttttttcggagttcatattctaatctgtctttattaaatcttagagatatta
15.gtattatatttttttatttttattattttagaatataatttgaggtatgtgtttaaaaaaaatttttttttttttttttttttttttttttttaaaatttataaatttaa
16.gttatttttaaatttaattttaattttaaaatacaaaatttttactttctaaaattggtctctggatcgataatgtaaacttattgaatctatagaattacattattgat
17.gtatgtctatttcacggaagaatgcaccactatatgatttgaaattatctatggctaaaaaccctcagtaaaatcaatccctaaacccttaaaaaacggcggcctatccc
18.gttaattatttattccttacgggcaattaattatttattacggttttatttacaattttttttttttgtcctatagagaaattacttacaaaacgttattttacatactt
19.gttacattatttattattatccgttatcgataattttttacctcttttttcgctgagtttttattcttactttttttcttctttatataggatctcatttaatatcttaa
20.gtatttaactctctttactttttttttcactctctacattttcatcttctaaaactgtttgatttaaacttttgtttctttaaggattttttttacttatcctctgttat
21.tttagctcagtccagctagctagtttacaatttcgacaccagtttcgcaccatcttaaatttcgatccgtaccgtaatttagcttagatttggatttaaaggatttagattga
22.tttagtacagtagctcagtccaagaacgatgtttaccgtaacgtqacgtaccgtacgctaccgttaccggattccggaaagccgattaaggaccgatcgaaaggg
23.cgggcggatttaggccgacggggacccgggattcgggacccgaggaaattcccggattaaggtttagcttcccgggatttagggcccggatggctgggaccc24.tttagctagctactttagctatttttagtagctagccagcctttaaggctagctttagctagcattgttctttattgggacccaagttcgacttttacgatttagttttgaccgt
25.gaccaaaggtgggctttagggacccgatgctttagtcgcagctggaccagttccccagggtattaggcaaaagctgacgggcaattgcaatttaggcttaggcca
26.gatttactttagcatttttagctgacgttagcaagcattagctttagccaatttcgcatttgccagtttcgcagctcagttttaacgcgggatctttagcttcaagctttttac
27.ggattcggatttacccggggattggcggaacgggacctttaggtcgggacccattaggagtaaatgccaaaggacgctggtttagccagtccgttaaggcttag
28.tccttagatttcagttactatatttgacttacagtctttgagatttcccttacgattttgacttaaaatttagacgttagggcttatcagttatggattaatttagcttattttcga
29.ggccaattccggtaggaaggtgatggcccgggggttcccgggaggatttaggctgacgggccggccatttcggtttagggagggccgggacgcgttagggc30.cgctaagcagctcaagctcagtcagtcacgtttgccaagtcagtaatttgccaaagttaaccgttagctgacgctgaacgctaaacagtattagctgatgactcgta
31.ttaaggacttaggctttagcagttactttagtttagttccaagctacgtttacgggaccagatgctagctagcaatttattatccgtattaggcttaccgtaggtttagcgt32.gctaccgggcagtctttaacgtagctaccgtttagtttgggcccagccttgcggtgtttcggattaaattcgttgtcagtcgctctrtgggtttagtcattcccaaaagg
33.cagttagctgaatcgtttagccatttgacgtaaacatgattttacgtacgtaaattttagccctgacgtttagctaggaatttatgctgacgtagcgatcgactttagcac
34.cggttagggcaaaggttggatttcgacccagggggaaagcccgggacccgaacccagggctttagcgtaggctgacgctaggcttaggttggaacccggaaa
35.gcggaagggcgtaggtttgggatgcttagccgtaggctagctttcgacacgatcgattcgcaccacaggataaaagttaagggaccggtaagtcgcggtagcc
36.ctagctacgaacgctttaggcgcccccgggagtagtcgttaccgttagtatagcagtcgcagtcgcaattcgcaaaagtccccagctttagccccagagtcgacg
37.gggatgctgacgctggttagctttaggcttagcgtagctttagggccccagtctgcaggaaatgcccaaaggaggcccaccgggtagatgccasagtgcaccgt
38.aacttttagggcatttccagttttacgggttattttcccagttaaactttgcaccattttacgtgttacgatttacgtataatttgaccttattttggacactttagtttgggttac
39.ttagggccaagtcccgaggcaaggaattctgatccaagtccaatcacgtacagtccaagtcaccgtttgcagctaccgtttaccgtacgttgcaagtcaaatccat
40.ccattagggtttatttacctgtttattttttcccgagaccttaggtttaccgtactttttaacggtttacctttgaaatttttggactagcttaccctggatttaacggccagttt
先感谢有心人看完那麽长的问题
小弟很好奇,为什麽要分A,B两类
目前猜测是否A,B两类代表"受感染"及"未受感染"的基因
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 118.170.197.54
1F:→ JosephX:如题目所说"构造分类方法有许多途径,例如提取序列的某些 09/17 03:33
2F:→ JosephX:特徵,给出它们的数学表示" 所以应该跟感染与否无关吧 ?? 09/17 03:34
3F:→ JosephX:如果从序列就知道感染与否也太强了?! 09/17 03:34
4F:→ JosephX:可能要分析一下,但光从两类粗浅来看,B就比A类多很多"t" 09/17 03:36
5F:→ JosephX:我想应该有很多方是可以作分类... 09/17 03:37
6F:→ turtle24:A跟B只是你对模型的定义而已 具A特徵分类到A下面 09/17 12:52
7F:→ turtle24:然後给你随机的序列去看看你的模型正不正确 09/17 12:52
8F:推 snark:其实这题拿去问作生物的一点都不难 关就就是上面长长的文章 09/17 14:53
9F:→ snark:提到基因编码 也提到蛋白编码 所以高AT的序列 暗指... 09/17 14:55