最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

帝國(guó)cms采集圖文教程(上,中,下)全集

  發(fā)布時(shí)間:2012-05-21 10:50:22   作者:佚名   我要評(píng)論
帝國(guó)cms采集圖文教程,現(xiàn)在把上,中,下全部都發(fā)來(lái).給大家方便的看.
帝國(guó)cms是我們用得比較多得PHP的建站系統(tǒng),在建站過(guò)程中,如果自己沒(méi)有信息源,只能靠手工不斷的重復(fù)copy和粘貼,這樣費(fèi)時(shí)費(fèi)力,于是我們就要使用帝國(guó)cms自帶的采集功能來(lái)完成信息的錄入。為了深入了解帝國(guó)cms采集功能,下面我們以“新浪各地新聞”欄目為例來(lái)進(jìn)行實(shí)戰(zhàn)采集。
  一、增加采集節(jié)點(diǎn)
  1、添加節(jié)點(diǎn):
  
1.jpg
 
  2、選擇要增加采集的欄目:
  
2.jpg
 
  3、進(jìn)入增加節(jié)點(diǎn)表單:
  
3.jpg
 
  4、在節(jié)點(diǎn)名稱(chēng)框里起個(gè)名字,然后把要采集的新浪各地新聞列表地址copy過(guò)來(lái):
  
4.jpg
 
  
4-1.jpg
 
  5、下來(lái)發(fā)現(xiàn)好多選項(xiàng),如“采集頁(yè)面地址方式二,內(nèi)容頁(yè)地址前綴...”先不要理他,后面再一一詳解,直接拉到 “信息鏈接區(qū)域正則”這里:
  
5.jpg
 
  6、這里是設(shè)置采集的列表信息鏈接區(qū)域正則,我們點(diǎn)擊查看新浪各地新聞列表“源文件”:
  
6.jpg
 
  7、把源文件代碼copy到Dreamweaver里,在Dreamweaver里選定要采集的信息鏈接區(qū)域:
  
7.jpg
 
  8、切換到Dreamweaver代碼方式,
    就是信息鏈接區(qū)域:
     
      
    8.jpg
     
      9、得到信息鏈接區(qū)域正則:
      
    9.jpg
     
      10、得到信息頁(yè)鏈接正則:
      
    10.jpg
     
      11、注意:如果信息頁(yè)鏈接是相對(duì)地址,例如< a href="/c/2012-03-05/205924063527.shtml" target="_blank" >,那么“內(nèi)容頁(yè)地址前綴”要加域名:
      
    11.jpg
     
      12、現(xiàn)在要采集內(nèi)容頁(yè)的標(biāo)題和內(nèi)容:
      
    12.jpg
     
      13、查看新聞頁(yè)“源文件”,找title標(biāo)簽:
      
    13.jpg
     
      14、取得標(biāo)題正則:
      
    14.jpg
     
      15、這里是要采集的內(nèi)容區(qū)域:
      
    15.jpg
     
      16、取得新聞內(nèi)容正則:
      
    16.jpg
     
      (注意:新聞內(nèi)容正則里的 d_id='*' 用了通配符,因?yàn)槊恳黄侣劦膁_id值是不同的,所以可以用*來(lái)代替它,“*”可以代替任意字符。)
      17、點(diǎn)擊提交按鈕就完成了整個(gè)采集節(jié)點(diǎn):
      
    6-6.JPG
     
      二、預(yù)覽采集節(jié)點(diǎn)是否正確
      1、提交按鈕后返回管理節(jié)點(diǎn):
      
    1.jpg
     
      2、點(diǎn)擊“預(yù)覽”采集,進(jìn)入節(jié)點(diǎn)預(yù)覽結(jié)果:
      
    2.jpg
     
      3、采集內(nèi)容頁(yè)列表
      
    3.jpg
     
      4、采集內(nèi)容頁(yè)頁(yè)面:
      
    4.jpg
     
      三、采集
      1、預(yù)覽采集節(jié)點(diǎn)無(wú)誤后,然后返回“管理節(jié)點(diǎn)”,點(diǎn)擊“開(kāi)始采集”鏈接就開(kāi)始進(jìn)行采集:
      
    1.jpg
     
      2、系統(tǒng)正在采集中:
      
    2.jpg
     
      3、采集完后顯示本地臨時(shí)入庫(kù)的信息,這時(shí)可以對(duì)臨時(shí)入庫(kù)的信息進(jìn)行修改或者刪除:
      
    3.jpg
     
      4、修改信息頁(yè)面如圖:
      
    4.jpg
     
      5、對(duì)采集的信息進(jìn)行審核并入庫(kù),點(diǎn)擊“入庫(kù)全部信息按鈕”:
      
    5.jpg
     
      6、確定操作:
      
    6.jpg
     
      7、信息入庫(kù)完畢提示:
      
    7.jpg
     
      信息入庫(kù)完畢后下來(lái)點(diǎn)擊”管理信息“:
      
    8.jpg
     
      我們可以看到剛剛采集入庫(kù)的新聞信息:
      
    9.jpg
     
      最后到“數(shù)據(jù)更新”刷新首頁(yè)、欄目、和內(nèi)容頁(yè)就可以完成網(wǎng)站的信息采集了。由于帝國(guó)cms采集功能非常強(qiáng)大,一時(shí)半刻也說(shuō)不完,下一頁(yè)將繼續(xù)講解其他功能的使用和技巧。
上一頁(yè)我們介紹了帝國(guó)cms采集基本流程,那么我們這一講介紹帝國(guó)cms如何采集內(nèi)容分頁(yè)。不少的同學(xué)在采集過(guò)程中,列表頁(yè)和內(nèi)容頁(yè)都能可以很好地設(shè)定正則,但往往失敗在內(nèi)容分頁(yè)正則上,主要是對(duì)內(nèi)容分頁(yè)正則不了解。帝國(guó)的內(nèi)容分頁(yè)形式有兩種:(1)全部列出式(2)上下頁(yè)導(dǎo)航式,但是這兩種內(nèi)容分頁(yè)形式有什么區(qū)別,采集內(nèi)容分頁(yè)時(shí)該用哪種,官方說(shuō)得比較模糊,對(duì)此有些同學(xué)感到很頭大,好的,我們先看下例子:
  一、全部列出式
  全部列表式只需看第一頁(yè)的頁(yè)面HTML代碼,這一頁(yè)的所有分頁(yè)鏈接都列出來(lái)了。
  1、我們以“中華網(wǎng)內(nèi)容分頁(yè)(http://auto.china.com/dongtai/yejie/11012724/20120309/17081442.html)”為例:
  
1.JPG
 
  可以看到這條新聞總共有3條分頁(yè)。
  2、查看源代碼:
  
2.jpg
 
  這一頁(yè)里除了已經(jīng)采集到的第1條分頁(yè)外,還包括了第2條和第3條分頁(yè),所有的分頁(yè)都列出來(lái)了。
  3、取得 分頁(yè)區(qū)域正則([!--smallpageallzz--]):
  
3.JPG
 
  4、取得 分頁(yè)鏈接正則([!--pageallzz--]):
  
4.JPG
 
  二、上下頁(yè)導(dǎo)航式
  上下頁(yè)導(dǎo)航式是分頁(yè)采集的難點(diǎn),他需要所有頁(yè)面都符合分頁(yè)正則才行,在不熟悉的情況下,我們可以用第1頁(yè)和第2頁(yè)的代碼來(lái)進(jìn)行對(duì)比分析然后確定分頁(yè)正則。
  1、我們以“愛(ài)麗網(wǎng)內(nèi)容分頁(yè)(http://fashion.aili.com/76/445845.html)”為例:
  
2-1.JPG
 
  可以看到這條新聞總共有20條分頁(yè)。
  2、查看源代碼:
  
2-2.jpg
 
  這一頁(yè)里除了已經(jīng)采集到的第1條分頁(yè)外,還包括了第2,第3,第4,第5,第6,第7,第8,第20條分頁(yè),但是第9到第19條分頁(yè)并沒(méi)有列出來(lái),這時(shí)候我們拿用第1頁(yè)和第2頁(yè)的代碼來(lái)進(jìn)行對(duì)比分析,來(lái)確定分頁(yè)正則:
  (1)第1頁(yè)代碼:
  
2-2-1.jpg
 
  (2)第2頁(yè)代碼:
  
2-2-2.jpg
 
  從這兩幅圖片可以看到他們有著相同的“分頁(yè)區(qū)域開(kāi)始代碼”,“分頁(yè)鏈接”格式,“分頁(yè)區(qū)域結(jié)束代碼”,那么就可以確定“分頁(yè)區(qū)域正則”,“分頁(yè)鏈接正則”。
  3、取得 分頁(yè)區(qū)域正則([!--smallpageallzz--]):
  
2-3.JPG
 
  4、取得 分頁(yè)鏈接正則([!--pageallzz--]):
  
2-4.jpg
 
  5、為了方便教程顯示,newstext我采集了標(biāo)題而不是采集內(nèi)容,預(yù)覽結(jié)果:
  
2-5.JPG
 
  注意事項(xiàng):
  第一、在第一頁(yè)的頁(yè)面HTML代碼里,內(nèi)容分頁(yè)鏈接全部列出來(lái)的情況下我們使用“全部列出式”。在第一頁(yè)的頁(yè)面HTML代碼里,內(nèi)容分頁(yè)鏈接沒(méi)有全部列出來(lái)的情況下我們使用“上下頁(yè)導(dǎo)航式”。
  第二、用全部列出式時(shí),采集規(guī)則正確但是莫名其妙的出現(xiàn)重復(fù)的分頁(yè),這時(shí)可以利用替換法把它過(guò)濾掉(下一講我們?cè)僬f(shuō))。
  第三、用上下頁(yè)導(dǎo)航式時(shí),老是采到第1頁(yè),其他頁(yè)連個(gè)影子都沒(méi)有見(jiàn)過(guò),這是因?yàn)榉猪?yè)區(qū)域正則([!--smallpagezz--])截取錯(cuò)誤。
  第四、用上下頁(yè)導(dǎo)航式時(shí),可以采集到前幾頁(yè)了,但是接下來(lái)這前幾頁(yè)全部重復(fù)循環(huán)到底,這也是因?yàn)榉猪?yè)區(qū)域正則([!--smallpagezz--])截取錯(cuò)誤,截取范圍過(guò)大,導(dǎo)致重復(fù)截取前幾個(gè)分頁(yè)鏈接。
  好的,這一講就到這里,下一頁(yè)我們主要介紹帝國(guó)cms采集過(guò)濾和替換。
前兩講我們分別介紹了帝國(guó)cms采集基本流程和帝國(guó)cms如何采集內(nèi)容分頁(yè),最后這一講主要介紹帝國(guó)cms采集過(guò)濾與替換,還有些技巧。
  一、過(guò)濾
  1、帝國(guó)cms采集過(guò)濾分為兩種:
  (1)“整體頁(yè)面過(guò)濾正則”:
  
1-1-1.JPG
 
  (2)“過(guò)濾廣告正則”:
  
1-1-2.JPG
 
  我們有些疑惑,這兩種過(guò)濾到底有什么區(qū)別?“整體頁(yè)面過(guò)濾正則”是過(guò)濾整個(gè)網(wǎng)頁(yè)的html代碼。“過(guò)濾廣告正則”是過(guò)濾文章內(nèi)容,僅對(duì)文章內(nèi)容([!--newstext--])起作用。
  2、過(guò)濾實(shí)例:
  過(guò)濾實(shí)例(1):
  
1-2-1.jpg
 
 
我們采集后發(fā)現(xiàn)信息內(nèi)容底部多了行代碼:“<div style="clear:both;height:0;visibility:hiddden;overflow:hidden;">&nbsp;</div>”,根據(jù)格式“廣告開(kāi)始[!--ad--]廣告結(jié)束”得到“過(guò)濾廣告正則
”:
  
1-2-2.JPG
 
  過(guò)濾實(shí)例(2):
  
1-2-3.jpg
 
  要過(guò)濾鏈接代碼怎么辦,注意“過(guò)濾廣告正則”右邊有堆代碼:
  
1-2-4.jpg
 
  鼠標(biāo)先點(diǎn)擊A,系統(tǒng)自動(dòng)生成過(guò)濾鏈接代碼“,,,”,這樣就可以把采集后的內(nèi)容鏈接過(guò)濾掉了。同理,如果想過(guò)濾其他html代碼就點(diǎn)擊相應(yīng)的標(biāo)簽代碼。

  注意事項(xiàng):當(dāng)內(nèi)容分頁(yè)包含在內(nèi)容([!--newstext--])里時(shí),要過(guò)濾掉內(nèi)容分頁(yè),否則會(huì)重復(fù)出現(xiàn)內(nèi)容分頁(yè)。
  二、替換
  1、帝國(guó)cms采集替換也分為兩種:
  (1)“整體頁(yè)面替換”:
  
2-1-1.JPG
 
  (2)“替換”:
  
2-1-2.JPG
 
  他們兩種區(qū)別:“整體頁(yè)面替換”是替換整個(gè)網(wǎng)頁(yè)的html代碼。“替換”是替換文章標(biāo)題和內(nèi)容,僅對(duì)標(biāo)題([!--title--])和([!--newstext--])起作用。
  2、替換實(shí)例:
  
2-1-3.JPG
 
  我們要把內(nèi)容里的“新華網(wǎng)”替換成“中華網(wǎng)”:
  
2-1-4.JPG
 
  預(yù)覽下:
  
2-1-5.jpg
 
  沒(méi)有問(wèn)題,替換過(guò)來(lái)了。
  三、圖片采集
  (1)我們采集時(shí)會(huì)碰到信息內(nèi)容可以正常采集,但是里面的圖片卻不顯示,例子:
  
3-1.jpg
 
  信息內(nèi)容可以正常采集,就是圖片不顯示出來(lái),這是由于內(nèi)容圖片的路徑不對(duì),圖片的路徑為相對(duì)地址。
  (2)查看源代碼:
  
3-2.jpg
 
  圖片是相對(duì)地址,要換成絕對(duì)地址才能采集成功。
  (3)替換成絕對(duì)地址:
  先在目標(biāo)站的圖片右鍵查看屬性:
  
3-3-1.jpg
 
  目標(biāo)站的圖片地址為“http://www.gdyd.com/news/PNews/a/e77366_634655073936250000.jpg”,我們采集所到的圖片地址為“/news/PNews/a/e77366_634655073936250000.jpg”,分析得到前綴“http://www.gdyd.com”,我們把前綴放到“圖片/FLASH地址前綴(內(nèi)容)”,如下圖:
  
3-3-2.JPG
 
  (4)前臺(tái)預(yù)覽圖片:
  圖片顯示出來(lái)了:
  
3-4-1.JPG
 
  查看源代碼:
  
3-4-2.JPG
 
  圖片地址沒(méi)錯(cuò),是本地地址。
  注意事項(xiàng):我們?cè)诓杉A(yù)覽和在本地臨時(shí)入庫(kù)信息時(shí),發(fā)現(xiàn)已經(jīng)添加了圖片地址前綴了,但是圖片還是不顯示,出現(xiàn)這個(gè)你不用理他,直接入庫(kù),入庫(kù)了系統(tǒng)才會(huì)自動(dòng)添加圖片地址前綴。
  至此采集實(shí)例講解完畢,這三講對(duì)帝國(guó)cms采集的基本流程,重點(diǎn),難點(diǎn)基本都概括了,還有些基礎(chǔ)的功能沒(méi)能一一介紹清楚,大家可以到帝國(guó)官方網(wǎng)站看下基礎(chǔ)教程。
  本文由 國(guó)外網(wǎng)站大全http://www.kguowai.com 原創(chuàng),轉(zhuǎn)載請(qǐng)注明出處,謝謝!

相關(guān)文章

最新評(píng)論

霍州市| 嘉定区| 寻乌县| 镇江市| 黑河市| 乌拉特前旗| 修文县| 彰化县| 凌云县| 凤阳县| 盐源县| 新巴尔虎左旗| 衡山县| 志丹县| 清镇市| 荃湾区| 镶黄旗| 灵川县| 浮山县| 齐河县| 安图县| 长垣县| 鸡东县| 石门县| 海南省| 甘德县| 和静县| 万宁市| 从化市| 建瓯市| 闽侯县| 五指山市| 湖口县| 江华| 西充县| 石屏县| 遂溪县| 虹口区| 朝阳区| 西丰县| 瓦房店市|