作者gloriosa (Gix.Andy)
看板Statistics
标题Re: [问题] 请问一题可能跟信赖程度有关的问题
时间Thu Oct 4 16:55:37 2007
1F:→ showponn:不过有看过类似的方法好像是假设有1000条随机序列 10/04 15:18
2F:推 showponn:用这1000条序列 跟使用者序列算分 10/04 15:22
3F:→ showponn:大於某特定分数的机率程度 来当作E-VALUE 10/04 15:23
4F:→ showponn:所以E-VALUE越小 代表这条序列用重要 因为出现可能性低 10/04 15:25
5F:→ showponn:但我也不是很懂他确切的算法 10/04 15:26
6F:→ showponn:所以希望有看过的人可以帮我解惑一下哦 谢谢啦!! 10/04 15:27
我觉得这做法比较偏向於检验当前现象(使用者序列)是否只是随机产生的
虽然我其实不是很知道你说的e-value是什麽(逃~)
不过在其他很多方法里都有把东西跟随机项比较以检验效果的作法
所以我觉得这个e可以比较偏那种东西
可是你现在想要做的听起来是要在资料库里选一些跟使用者相像的DNA呈现给他
(我有误会吗?)
所以我猜那个e的功能其实不是你要的
※ 引述《gloriosa (Gix.Andy)》之铭言:
: 我有一个想法
: 请大家鞭小力一点...
: 方法是这样
: 你拿输入的序列(Ai)对资料库(A1~A10000)做出10000个r
: 也就有10000个r^2
: 由大至小排序r^2并画图(大小 x r^2)
: 在图形骤降的地方切割
: 骤降看是要算回归线(maybe logistic)然後微分
: 或是邻近两点的差值都好
: 当然这样你还是要订一个标准
: (回归或差值要下降多少才切)
: 不过可能
: 比较有感觉吧XD
: ※ 引述《showponn (showpon)》之铭言:
: : 大家好 我是资工所的学生 只有在大学时学过一点点统计
: : 想请问大家一个最近遇到的问题 如下:
: : 假设现在手中有一万条dna序列
: : 现在要做一个系统 让使用者可以每次输入一条序列 去和这一万条算相似度
: : 每一个相似度 都有一个分数来代表 分数越高就是相似度越高 反之就越低
: : 但是我们的系统 希望呈现给使用者的只有那些相似度高的序列
: : 被判断成相似度低的序列 就不呈现出来
: : 我的困惑在於 如何从这一万个分数的分布里 算出一个合理的门槛
: : 把分数低於门槛的都视为不相似 (其实方法不需太精确 能大略判断出合理门槛就行)
: : 感觉这需要一些统计的方法
: : 麻烦各位高手可以拨个空 帮我解惑一下
: : haha 小弟感激不尽!!!!
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 140.112.4.234