作者gloriosa (Gix.Andy)
看板Statistics
标题Re: [问题] 请问一题可能跟信赖程度有关的问题
时间Thu Oct 4 10:05:34 2007
我有一个想法
请大家鞭小力一点...
方法是这样
你拿输入的序列(Ai)对资料库(A1~A10000)做出10000个r
也就有10000个r^2
由大至小排序r^2并画图(大小 x r^2)
在图形骤降的地方切割
骤降看是要算回归线(maybe logistic)然後微分
或是邻近两点的差值都好
当然这样你还是要订一个标准
(回归或差值要下降多少才切)
不过可能
比较有感觉吧XD
※ 引述《showponn (showpon)》之铭言:
: 大家好 我是资工所的学生 只有在大学时学过一点点统计
: 想请问大家一个最近遇到的问题 如下:
: 假设现在手中有一万条dna序列
: 现在要做一个系统 让使用者可以每次输入一条序列 去和这一万条算相似度
: 每一个相似度 都有一个分数来代表 分数越高就是相似度越高 反之就越低
: 但是我们的系统 希望呈现给使用者的只有那些相似度高的序列
: 被判断成相似度低的序列 就不呈现出来
: 我的困惑在於 如何从这一万个分数的分布里 算出一个合理的门槛
: 把分数低於门槛的都视为不相似 (其实方法不需太精确 能大略判断出合理门槛就行)
: 感觉这需要一些统计的方法
: 麻烦各位高手可以拨个空 帮我解惑一下
: haha 小弟感激不尽!!!!
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 140.112.4.234
1F:推 showponn:谢谢你阿!! 我知道条件给不太够 你还能帮我想出这个方法 10/04 13:37
2F:→ showponn:後来看了一下 发现很多人是用E-value在解我这种问题 10/04 14:04
3F:→ showponn:不过网路上查到很少关於e-value 的算法 10/04 14:05
4F:→ showponn:不知道有人对这种方法有了解吗? 10/04 14:06
5F:推 gloriosa:expectation value? 10/04 14:14
6F:推 showponn:字面上是这样没错 10/04 15:18
7F:→ showponn:不过有看过类似的方法好像是假设有1000条随机序列 10/04 15:18
8F:推 showponn:用这1000条序列 跟使用者序列算分 10/04 15:22
9F:→ showponn:大於某特定分数的机率程度 来当作E-VALUE 10/04 15:23
10F:→ showponn:所以E-VALUE越小 代表这条序列用重要 因为出现可能性低 10/04 15:25
11F:→ showponn:但我也不是很懂他确切的算法 10/04 15:26
12F:→ showponn:所以希望有看过的人可以帮我解惑一下哦 谢谢啦!! 10/04 15:27