作者sleepwu ( hopeful)
看板CodeJob
标题[发案] 抓网页资料
时间Fri Jul 20 19:00:09 2012
案件状态:已结案
发案人:吴先生
联络方式1:[email protected]
联络方式2:站内信
所在地区 :
有效时间:即日起
专案说明:我有一批书的ISBN,大约十万笔
想到全国书目资讯网
http://nbinet3.ncl.edu.tw/search
去抓每本书的编目档(点击以"机读格式显示"即是),
如
http://ppt.cc/PCqL网页中,
LEADER 00000cam2 2200289 450C
001 DYNIX__501576
005 20081017165201.0
008
010 0 978-986-6881-76-3|b平装|dNT$250
042 nbi9809bp01
100 20080415d2007 k y0chiy09 e
101 0 chi
102 tw
105 a z 000yy
200 1 机器人|h1|f姚松麟等作
205 再版
210 台北市|c旗林文化出版|c三友图书总代理|d2007[民96]
215 0 184面|c彩图|d21公分
225 1 生活学习|v45
225 1 NXT系列|v1
516 11 Robot机器人1|zchi
606 |2csh|a机器人
606 |2csh|a九年一贯课程
606 |2csh|a科技教育
606 |2csh|a电脑教育
681 523.36|b4240|v增订八版
700 1 姚|b松麟|4作
801 2 tw|bPTL|c20080624|gCCR|m4
805 PTL|c31120008359076ptl|d523.36|e4240|f03|yv.1|tCCL|w20|x20
|z681
这串文字。但每个ISBN的搜寻结果可能不只一笔,也可能不只一层。
(如
http://ppt.cc/6KAg,搜寻结果有两笔)
我只要每一层的第一笔的资料即可,即一本书抓到一个编目档即可。
若搜寻不到这本书则跳过。
我不需要程式码,不需要执行档,您可以用任何您熟悉的语言跟方式
只要把这批编目档抓给我即可。
预算:来信报价,并请说明您预计使用什麽方式执行,预估时程须多久
接案者要求:无要求
接受新手承案否:否
附注:
若您可以进一步只撷取编目档中的特定文字的话更好
关於撷取特定文字,因为其实我想要的是书的分类号
但编目档其实有可能是不同格式
但判断方式就是:
1.若ISBN出现在前三码为010的那行,则分类号会注记於前三码为681的那行,就撷取那行
2.若ISBN出现在前三码为020的那行,则分类号会注记於前三码为090的那行,就撷取那行
3.若ISBN有出现於010或020的那行,但却没有681或090,那麽这笔可以跳过(表示他没有
分类号)
若这步骤很麻烦的话也可以不做,因为我已写好从编目档撷取分类号的函式
只是效率没有很好,将就用用
(以下内容鼓励结案後填写,可以询问接案人愿不愿意暴光接案身份)
结案意见:
接案人:
评价(0-10):
说明:
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 118.160.228.104
※ 编辑: sleepwu 来自: 118.160.228.104 (07/20 19:02)
1F:→ pa4373:已寄信喔谢谢 07/20 20:50
2F:→ kiii210:已寄信..好多人@@.. 07/20 21:02
3F:→ sleepwu:目前已有多人来信 陆续与各位讨论中 请各位先不必开始作业 07/21 00:56
4F:→ sleepwu:若确定要请您帮忙会再与您确认 谢谢喔 07/21 00:57
※ 编辑: sleepwu 来自: 118.160.228.104 (07/21 01:36)
※ 编辑: sleepwu 来自: 114.43.90.124 (07/22 03:39)
※ 编辑: sleepwu 来自: 114.43.90.124 (07/22 17:00)