精選分類 書庫 完本 排行 原創專區
欣可小說 > 曆史 > 網絡安全產品 > ◎第一章 並行計算(4)

網絡安全產品 ◎第一章 並行計算(4)

作者:張建國 分類:曆史 更新時間:2026-08-10 20:58:55

{

\"code\": 200,

\"title\": \"\",

\"content\": \"體繫結構\\n\\n數據源\\n\\n是數據倉庫係統的基礎,是整個係統的數據源泉。通常包括企業內部資訊和外部資訊。內部資訊包括存放於RDBMS中的各種業務處理數據和各類文檔數據。外部資訊包括各類法律法規、市場資訊和競爭對手的資訊等等;\\n\\n數據的存儲與管理是整個數據倉庫係統的核心。數據倉庫的真正關鍵是數據的存儲和管理。數據倉庫的組織管理方式決定了它有彆於傳統數據庫,同時也決定了其對外部數據的表現形式。要決定采用什麼產品和技術來建立數據倉庫的核心,則需要從數據倉庫的技術特點著手分析。針對現有各業務係統的數據,進行抽取、清理,並有效整合,按照主題進行組織。數據倉庫按照數據的覆蓋範圍可以分為企業級數據倉庫和部門級數據倉庫(通常稱為數據集市)。\\n\\nOLAP(聯機分析處理)服務器\\n\\n對分析需要的數據進行有效整合,按多維模型予以組織,以便進行多角度、多層次的分析,併發現趨勢。其具體實現可以分為:ROLAP(關係型在線分析處理)、MOLAP(多維在線分析處理)和HOLAP(混合型線上分析處理)。ROLAP基本數據和聚合數據均存放在RDBMS之中;MOLAP基本數據和聚合數據均存放於多維數據庫中;HOLAP基本數據存放於RDBMS之中,聚合數據存放於多維數據庫中。\\n\\n前端工具\\n\\n主要包括各種報表工具、查詢工具、數據分析工具、數據挖掘工具以數據挖掘及各種基於數據倉庫或數據集市的應用開發工具。其中數據分析工具主要針對OLAP服務器,報表工具、數據挖掘工具主要針對數據倉庫。\\n\\n組成\\n\\n數據倉庫數據庫\\n\\nIBM數據倉庫解決方案產品組成\\n\\n是整個數據倉庫環境的核心,是數據存放的地方和提供對數據檢索的支援。相對於操縱型數據庫來說其IBM數據倉庫解決方案產品組成突出的特點是對海量數據的支援和快速的檢索技術。\\n\\n數據抽取工具\\n\\n把數據從各種各樣的存儲方式中拿出來,進行必要的轉化、整理,再存放到數據倉庫內。對各種不同數據存儲方式的訪問能力是數據抽取工具的關鍵,應能生成COBOL程式、MVS作業控製語言(JCL)、UNIX腳本、和SQL語句等,以訪問不同的數據。數據轉換都包括,刪除對決策應用冇有意義的數據段;轉換到統一的數據名稱和定義;計算統計和衍生數據;給缺值數據賦給預設值;把不同的數據定義方式統一。\\n\\n元數據\\n\\n元數據是描述數據倉庫內數據的結構和建立方法的數據。可將其按用途的不同分為兩類,技術元數據和商業元數據。\\n\\n技術元數據是數據倉庫的設計和管理人員用於開發和日常管理數據倉庫是用的數據。包括:數據源資訊;數據轉換的描述;數據倉庫內對象和數據結構的定義;數據清理和數據更新時用的規則;源數據到目的數據的對映;用戶訪問權限,數據備份曆史記錄,數據導入曆史記錄,資訊釋出曆史記錄等。\\n\\n商業元數據從商業業務的角度描述了數據倉庫中的數據。包括:業務主題的描述,包含的數據、查詢、報表;元數據為訪問數據倉庫提供了一個資訊目錄(informationdirectory),這個目錄全麵描述了數據倉庫中都有什麼數據、這些數據怎麼得到的、和怎麼訪問這些數據。是數據倉庫運行和維護的中心,數據倉庫服務器利用他來存貯和更新數據,用戶通過他來瞭解和訪問數據。\\n\\n訪問工具\\n\\n為用戶訪問數據倉庫提供手段。有數據查詢和報表工具;應用開發工具;管理資訊係統(EIS)工具;在線分析(OLAP)工具;數據挖掘工具。\\n\\n數據集市(DataMarts)\\n\\n為了特定的應用目的或應用範圍,而從數據倉庫中獨立出來的一部分數據,也可稱為部門數據或主題數據(subjectarea)。在數據倉庫的實施過程中往往可以從一個部門的數據集市著手,以後再用幾個數據集市組成一個完整的數據倉庫。需要注意的就是在實施不同的數據集市時,同一含義的欄位定義一定要相容,這樣在以後實施數據倉庫時纔不會造成大麻煩。\\n\\n數據倉庫管理\\n\\n安全和特權管理;跟蹤數據的更新;數據質量檢查;管理和更新元數據;審計和報告數據倉庫的使用和狀態;刪除數據;複製、分割和分發數據;備份和恢複;存儲管理。\\n\\n資訊釋出係統\\n\\n把數據倉庫中的數據或其他相關的數據發送給不同的地點或用戶。基於Web的資訊釋出係統是對付多用戶訪問的最有效方法。\\n\\n設計步驟\\n\\n1)選擇合適的主題(所要解決問題的領域)\\n\\n2)明確定義事實表\\n\\n3)確定和確認維\\n\\n4)選擇事實表\\n\\n5)計算並存儲fact表中的衍生數據段6)轉換維表\\n\\n7)數據庫數據采集\\n\\n8)根據需求重新整理維表\\n\\n9)確定查詢優先級和查詢模式。\\n\\n硬體平台:數據倉庫的硬盤容量通常要是操作數據庫硬盤容量的2-3倍。通常大型機具有更可靠的效能和和穩定性,也容易與曆史遺留的係統結合在一起;而PC服務器或UNIX服務器更加靈活,容易操作和提供動態生成查詢請求進行查詢的能力。選擇硬體平台時要考慮的問題:是否提供並行的I\\/O吞吐?對多CPU的支援能力如何?\\n\\n數據倉庫DBMS:他的存儲大數據量的能力、查詢的效能、和對並行處理的支援如何。\\n\\n網絡結構:數據倉庫的實施在那部分網絡段上會產生大量的數據通訊,需不需要對網絡結構進行改進。\\n\\n建立步驟\\n\\n步驟\\n\\n1)收集和分析業務需求\\n\\n數據倉庫價值曲線\\n\\n數據倉庫價值曲線\\n\\n2)建立數據模型和數據倉庫的物理設計3)定義數據源\\n\\n4)選擇數據倉庫技術和平台\\n\\n5)從操作型數據庫中抽取、淨化、和轉換數據到數據倉庫\\n\\n6)選擇訪問和報表工具\\n\\n7)選擇數據庫連接軟件\\n\\n8)選擇數據分析和數據展示軟件\\n\\n9)更新數據倉庫\\n\\n數據轉換工具\\n\\n1)數據轉換工具要能從各種不同的數據源中讀取數據。\\n\\n2)支援平麵檔案、索引檔案、和legacyDBMS。\\n\\n3)能以不同類型數據源為輸入整合數據。\\n\\n4)具有規範的數據訪問介麵\\n\\n5)最好具有從數據字典中讀取數據的能力6)工具生成的代碼必須是在開發環境中可維護的7)能隻抽取滿足指定條件的數據,和源數據的指定部分8)能在抽取中進行數據類型轉換和字元集轉換9)能在抽取的過程中計算生成衍生欄位10)能讓數據倉庫管理係統自動調用以定期進行數據抽取工作,或能將結果生成平麵檔案11)必須對軟件供應商的生命力和產品支援能力進行仔細評估主要數據抽取工具供應商:Prismsolutions.Carleton'sPASSPORT.InformationBuildersInc.'s EDA\\/SQL.SASInstituteInc.\\n\\n數據倉庫帶來了什麼\\n\\n每一家公司都有自己的數據。並且,許多公司在計算機係統中儲存有大量的數據,記錄著企業購買、銷售、生產過程中的大量資訊和客戶的資訊。通常這些數據都儲存在許多不同的地方。\\n\\n使用數據倉庫之後,企業將所有收集來的資訊存放在一個唯一的地方——數據倉庫。倉庫中的數據按照一定的方式組織,從而使得資訊容易存取並且有使用價值。\\n\\n目前,已經開發出一些專門的軟件工具,使數據倉庫的過程實現可以半自動化,幫助企業將數據導入數據倉庫,並使用那些已經存入倉庫的數據。\\n\\n數據倉庫給組織帶來了巨大的變化。數據倉庫的建立給企業帶來了一些新的工作流程,其他的流程也因此而改變。\\n\\n數據倉庫為企業帶來了一些“以數據為基礎的知識”,它們主要應用於對市場戰略的評價,和為企業發現新的市場商機,同時,也用來控製庫存、檢查生產方法和定義客戶群。\\n\\n每一家公司都有自己的數據。數據倉庫將企業的數據按照特定的方式組織,從而產生新的商業知識,併爲企業的運作帶來新的視角。\\n\\n為何要建立數據倉庫\\n\\n計算機發展的早期,人們已經提出了建立數據倉庫的構想。“數據倉庫”一詞最早是在1990年,由BillInmon先生提出的,其描述如下:數據倉庫是為支援企業決策而特彆設計和建立的數據集合。\\n\\n企業建立數據倉庫是為了填補現有數據存儲形式已經不能滿足資訊分析的需要。數據倉庫理論中的一個核心理念就是:事務型數據和決策支援型數據的處理效能不同。\\n\\n企業在它們的事務操作收集數據。在企業運作過程中:隨著定貨、銷售記錄的進行,這些事務型數據也連續的產生。為了引入數據,我們必須優化事務型數據庫。\\n\\n處理決策支援型數據時,一些問題經常會被提出:哪類客戶會購買哪類產品?促銷後銷售額會變化多少?價格變化後或者商店地址變化後銷售額又會變化多少呢?在某一段時間內,相對其他產品來說哪類產品特彆容易賣呢?哪些客戶增加了他們的購買額?哪些客戶又削減了他們的購買額呢?\\n\\n事務型數據庫可以為這些問題作出解答,但是它所給出的答案往往並不能讓人十分滿意。在運用有限的計算機資源時常常存在著競爭。在增加新資訊的時候我們需要事務型數據庫是空閒的。而在解答一係列具體的有關資訊分析的問題的時候,係統處理新數據的有效性又會被大大降低。另一個問題就在於事務型數據總是在動態的變化之中的。決策支援型處理需要相對穩定的數據,從而問題都能得到一致連續的解答。\\n\\n數據倉庫的解決方法包括:將決策支援型數據處理從事務型數據處理中分離出來。數據按照一定的週期(通常在每晚或者每週末),從事務型數據庫中導入決策支援型數據庫——既“數據倉庫”。數據倉庫是按回答企業某方麵的問題來分“主題”組織數據的,這是最有效的數據組織方式。\\n\\n數據倉庫和數據集市\\n\\n數據倉庫基本體繫結構\\n\\n有關決策支援型數據庫的數據集市是麵向企業中的某個部門或是項目小組的。一些專家顧問將數據集市數據倉庫基本體繫結構的建造描述為建立數據倉庫全過程中的一步。首先,一個儲存企業全部資訊的數據倉庫被創建,其中,數據均具備有組織的、一致的、不變的格式。數據集市隨後被創立,其目的是為不同部門提供他們所需要的那部分資訊。數據倉庫聚集了所有詳細的資訊,而數據集市中的數據則是針對用戶們的特定需求總結而出的。\\n\\n而另外一些專家則認為數據集市的建立並不需要首先建立一個數據倉庫。在這個模型中,數據直接由事務型數據庫轉入數據集市中。一個公司可能建立有多個數據集市,而彼此之間毫無聯絡。\\n\\n這種不在建立數據倉庫的基礎上創建數據集市的方式會更便宜、更快速,因為它的規模更加易於管理。\\n\\n第二種觀點的缺陷在於無法實現最初創建數據倉庫的最主要的目的——將企業所有的數據統一為一致的格式。現有的事務處理係統的數據往往是不一致、冗餘的。如果首先建立起一個全公司範圍的數據倉庫,組織就能夠獲得一個統一關於企業的活動和客戶的知識庫。如果先建立起一個個獨立的數據集市,那麼數據倉庫的諸多優勢都能夠得以實現,但是企業遠遠無法做到對數據的一致的儲存。\\n\\n數據倉庫與數據庫的關係\\n\\n二者的聯絡:\\n\\n數據倉庫的出現,並不是要取代數據庫。目前,大部分數據倉庫還是用關係數據庫管理係統來管理的。可以說,數據庫、數據倉庫相輔相成、各有千秋。\\n\\n二者的區彆\\n\\n1、出發點不同:數據庫是麵向事務的設計;數據倉庫是麵向主題設計的。\\n\\n2、存儲的數據不同:數據庫一般存儲在線交易數據;數據倉庫存儲的一般是曆史數據。\\n\\n3、設計規則不同:數據庫設計是儘量避免冗餘,一般采用符合範式的規則來設計;數據倉庫在設計是有意引入冗餘,采用反範式的方式來設計。\\n\\n4、提供的功能不同:數據庫是為捕獲數據而設計,數據倉庫是為分析數據而設計,\\n\\n5、基本元素不同:數據庫的基本元素是事實表,數據倉庫的基本元素是維度表。\\n\\n6、容量不同:數據庫在基本容量上要比數據倉庫小的多。\\n\\n7、服務對象不同:數據庫是為了高效的事務處理而設計的,服務對象為企業業務處理方麵的工作人員;數據倉庫是為了分析數據進行決策而設計的,服務對象為企業高層決策人員。\\n\\n網格計算\\n\\n網格計算即分散式計算,是一門計算機科學。它研究如何把一個需要非常巨大的計算能力才能解決的問題分成許多小的部分,然後把這些部分分配給許多計算機進行處理,最後把這些計算結果綜合起來得到最終結果。最近的分散式計算項目已經被用於使用世界各地成千上萬誌願者的計算機的閒置計算能力,通過因特網,您可以分析來自外太空的電訊號,尋找隱蔽的黑洞,並探索可能存在的外星智慧生命;您可以尋找超過1000萬位數字的梅森質數;您也可以尋找併發現對抗艾滋病毒更為有效的藥物。用以完成需要驚人的計算量的龐大項目。\\n\\n分散式計算是利用互聯網上的計算機的CPU的閒置處理能力來解決大型計算問題的一種計算科學。\\n\\n隨著計算機的普及,個人電腦開始進入千家萬戶。與之伴隨產生的是電腦的利用問題。越來越多的電腦處於閒置狀態,即使在開機狀態下CPU的潛力也遠遠不能被完全利用。我們可以想象,一台家用的計算機將大多數的時間花費在“等待”上麵。即便是使用者實際使用他們的計算機時,處理器依然是寂靜的消費,依然是不計其數的等待(等待輸入,但實際上並冇有做什麼)。互聯網的出現,使得連接調用所有這些擁有限製計算資源的計算機係網格計算覆蓋範圍統成為了現實。\\n\\n網格計算覆蓋範圍那麼,一些本身非常複雜的但是卻很適合於劃分爲大量的更小的計算片斷的問題被提出來,然後由某個研究機構通過大量艱辛的工作開發出計算用服務端和客戶端。服務端負責將計算問題分成許多小的計算部分,然後把這些部分分配給許多聯網參與計算的計算機進行並行處理,最後將這些計算結果綜合起來得到最終的結果。\\n\\n實踐證明是的確可行的\\n\\n當然,這看起來也似乎很原始、很困難,但是隨著參與者和參與計算的計算機的數量的不斷增加,計算計劃變得非常迅速,而且被實踐證明是的確可行的。目前一些較大的分散式計算項目的處理能力已經可以達到甚而超過目前世界上速度最快的巨型計算機。您也可以選擇參加某些項目以捐贈的Cpu內核處理時間,您將發現您所提供的CPU內核處理時間將出現在項目的貢獻統計中。您可以和其他的參與者競爭貢獻時間的排名,您也可以加入一個已經存在的計算團體或者自己組建一個計算小組。這種方法很利於調動參與者的熱情。\\n\\n中國分散式總站及論壇\\n\\n隨著民間的組隊逐漸增多,許多大型組織(例如公司、學校和各種各樣的網站)也開始了組建自己的戰隊。同時,也形成了大量的以分散式計算技術和項目討論為主題的社區,這些社區多數是翻譯製作分散式計算項目的使《網格計算核心技術》\\n\\n用教程及釋出相關技術性文章,並提供必要的技術支援。那麼誰可能加入到這些項目中來呢?\\n\\n《網格計算核心技術》當然是任何人都可以!如果您已經加入了某個項目,而且曾經考慮加入計算小組,您將在中國分散式計算總站及論壇裡找到您的家。任何人都能加入任何由我站的組建的分散式計算小組。希望您在中國分散式總站及論壇裡發現樂趣。\\n\\n參與分散式計算\\n\\n參與分散式計算——一種能充分發揮您的個人電腦的利用價值的最有意義的選擇——隻需要下載有關程式,然後這個程式會以最低的優先度在計算機上運行,這對平時正常使用計算機幾乎冇有影響。如果你想利用計算機的空餘時間做點有益的事情,還猶豫什麼?馬上行動起來吧,你的微不足道的付出或許就能使你在人類科學的發展史上留下不小的一筆呢!\\n\\n專業定義\\n\\n(中國科學技術資訊研究所對分散式計算的定義)分散式計算是近年提出的一種新的計算方式。所謂分散式計算就是在兩個或多個軟件互相共享資訊,這些軟件既可以在同一台計算機上運行,也可以在通過網絡連接起來的多台計算機上運行。\\n\\n優點\\n\\n分散式計算比起其它演算法具有以下幾個優點:\\n\\n1、稀有資源可以共享,\\n\\n2、通過分散式計算可以在多台計算機上平衡計算負載,\\n\\n3、可以把程式放在最適合運行它的計算機上,其中,共享稀有資源和平衡負載是計算機分散式計算的核心思想之一。\\n\\n實際上,網格計算就是分散式計算的一種。如果我們說某項工作是分散式的,那麼,參與這項工作的一定不隻是一台計算機,而是一個計算機網絡,顯然這種“螞蟻搬山”的方式將具有很強的數據處理能力。\\n\\n工作原理\\n\\n下麵,我們看看它是怎麼工作的:首先,要發現一個需要非常巨大的計算能力才能解決的問題。這類問題一般是跨學科的、極富挑戰性的、人類急待解決的科研課題。其中較為著名的是:\\n\\n1.解決較為複雜的數學問題,例如:GIMPS(尋找最大的梅森素數)。\\n\\n2.研究尋找最為安全的密碼係統,例如:RC-72(密碼破解)。\\n\\n3.生物病理研究,例如:Folding@home(研究蛋白質摺疊,誤解,聚合及由此引起的相關疾病)。\\n\\n4.各種各樣疾病的藥物研究,例如:UnitedDevices(尋找對抗癌症的有效的藥物)。\\n\\n5.信號處理,例如:SETI@Home(在家尋找地外文明)。\\n\\n從這些實際的例子可以看出,這些項目都很龐大,需要驚人的計算量,僅僅由單個的電腦或是個人在一個能讓人接受的時間內計算完成是決不可能的。在以前,這些問題都應該由超級計算機來解決。但是,超級計算機的造價和維護非常的昂貴,這不是一個普通的科研組織所能承受的。隨著科學的發展,一種廉價的、高效的、維護方便的計算方法應運而生——分散式計算!\\n\\n網格計算優勢\\n\\n網格計算的目的是,通過任何一台計算機都可以提供無限的計算能力,可以接入浩如煙海的資訊。這種環境將能夠使各企業解決以前難以處理的問題,最有效地使用他們的係統,滿足客戶要求並降低他們計算機資源的擁有和管理總成本。網格計算的主要目的是設計一種能夠提供以下功能的係統:提高或拓展型企業內所有計算資源的效率和利用率,滿足最終用戶的需求,同時能夠解決以前由於計算、數據或存儲資源的短缺而無法解決的問題。\\n\\n建立虛擬組織,通過讓他們共享應用和數據來對公共問題進行合作。\\n\\n整合計算能力、存儲和其他資源,能使得需要大量計算資源的巨大問題求解成為可能。\\n\\n通過對這些資源進行共享、有效優化和整體管理,能夠降低計算的總成本。\\n\\n網格計算環境\\n\\n現在,網格計算主要被各大學和研究實驗室用於高效能計算的項目。這些項目要求巨大的計算能力,或需要接入大量數據。\\n\\n網格計算的目的是支援所有行業的電子商務應用。例如,飛機和汽車等複雜產品的生產要求對產品設計、產品組裝和產品生命週期管理進行計算密集型模擬。其他一些實例還有,通過MonteCarlo方法對複雜金融環境的模擬,以及生命科學領域的許多項目。\\n\\n網格環境的最終目的是,從簡單的資源集中發展到數據共享,最後發展到協作處理和有質量的服務(QualityofService)。\\n\\n資源集中——使公司用戶能夠將公司的整個IT基礎設施看作是一台計算機,能夠根據他們的需要找到尚未被利用的資源。\\n\\n數據共享——使各公司接入遠程數據。這對某些生命科學項目尤其有用,因為在這些項目中,各公司需要和其他公司共享人類基因數據。\\n\\n通過網格計算來合作——使廣泛分散在各地的組織能夠在一定的項目上進行合作,整合業務流程,共享從工程藍圖到軟件應用程式等所有資訊,協同處理項目中的問題。\\n\\n有質量的服務(QoS)——是指能針對不同用戶或者不同數據流采用相應不同的優先級,或者是根據應用程式的要求,保證數據流的效能達到一定的水準。為同一網絡中的各結點提供質量有保障的服務。\\n\\n數據壓縮\\n\\n數據壓縮是指在不丟失資訊的前提下,縮減數據量以減少存儲空間,提高其傳輸、存儲和處理效率的一種技術方法。或按照一定的演算法對數據進行重新組織,減少數據的冗餘和存儲的空間。數據壓縮包括有損壓縮和無損壓縮。\\n\\n在計算機科學和資訊論中,數據壓縮或者源編碼是按照特定的編碼機製用比未經編碼少的數據位元(或者其它資訊相關的單位)表示資訊的過程。例如,如果我們將“compression”編碼為“comp”那麼這篇文章可以用較少的數據位表示。一種流行的壓縮實例是許多計算機都在使用的ZIP檔案格式,它不僅僅提供了壓縮的功能,而且還作為歸檔工具(Archiver)使用,能夠將許多檔案存儲到同一個檔案中。\\n\\n概要\\n\\n對於任何形式的通訊來說,隻有當資訊的發送方和接受方都能夠理解編碼機製的時候壓縮數據通訊才能夠工作。例如,隻有當接受方知道這篇文章需要用英語字元解釋的時候這篇文章纔有意義。同樣,隻有當接受方知道編碼方法的時候他才能夠理解壓縮數據。一些壓縮演算法利用了這個特性,在壓縮過程中對數據進行加密,例如利用密碼加密,以保證隻有得到授權的一方纔能正確地得到數據。\\n\\n數據壓縮能夠實現是因為多數現實世界的數據都有統計冗餘。例如,字母“e”在英語中比字母“z”更加常用,字母“q”後麵是“z”的可能性非常小。無損壓縮演算法通常利用了統計冗餘,這樣就能更加簡練地、但仍然是完整地表示發送方的數據。\\n\\n如果允許一定程度的保真度損失,那麼還可以實現進一步的壓縮。例如,人們看圖畫或者電視畫麵的時候可能並不會注意到一些細節並不完善。同樣,兩個音頻錄音采樣序列可能聽起來一樣,但實際上並不完全一樣。有損壓縮演算法在帶來微小差彆的情況下使用較少的位數表示圖像、視頻或者音頻。\\n\\n由於可以幫助減少如硬盤空間與連接帶寬這樣的昂貴資源的消耗,所以壓縮非常重要,然而壓縮需要消耗資訊處理資源,這也可能是費用昂貴的。所以數據壓縮機製的設計需要在壓縮能力、失真度、所需計算資源以及其它需要考慮的不同因素之間進行折衷。\\n\\n一些機製是可逆的,這樣就可以恢複原始的數據,這種機製稱為無損數據壓縮;另外一些機製爲了實現更高的壓縮率允許一定程度的數據損失,這種機製稱為有損數據壓縮。\\n\\n然而,經常有一些檔案不能被無損數據壓縮演算法壓縮,實際上對於不含可以辨彆樣式的數據任何壓縮演算法都不能壓縮。試圖壓縮已經經過壓縮的數據通常得到的結果實際上是擴展數據,試圖壓縮經過加密的數據通常也會得到這種結果。\\n\\n實際上,有損數據壓縮也會最終達到不能工作的地步。我們來舉一個極端的例子,壓縮演算法每次去掉檔案最後一個字節,那麼經過這個演算法不斷的壓縮直至檔案變空,壓縮演算法將不能繼續工作。\\n\\n原理\\n\\n事實上,多媒體資訊存在許多數據冗餘。例如,一幅圖像中的靜止建築背景、藍天和綠地,其中許多畫素是相同的如果逐點存儲,就會浪費許多空間,這稱為空間冗餘。又如,在電視和動畫的相鄰序列中,隻有運動物體有少許變化,僅存儲差異部分即可,這稱為時間冗餘。此外還有結構冗餘、視覺冗餘等,這就為數據壓縮提供了條件。\\n\\n總之,壓縮的理論基礎是資訊論。從資訊的角度來看,壓縮就是去除掉資訊中的冗餘,即去除掉確定的或可推知的資訊,而保留不確定的資訊,也就是用一種更接近資訊本質的描述來代替原有的冗餘的描述,這個本質的東西就是資訊量。\\n\\n應用\\n\\n一種非常簡單的壓縮方法是行程長度編碼,這種方法使用數據及數據長度這樣簡單的編碼代替同樣的連續數據,這是無損數據壓縮的一個實例。這種方法經常用於辦公計算機以更好地利用磁盤空間、或者更好地利用計算機網絡中的帶寬。對於電子錶格、文字、可執行檔案等這樣的符號數據來說,無損是一個非常關鍵的要求,因為除了一些有限的情況,大多數情況下即使是一個數據位的變化都是無法接受的。\\n\\n對於視頻和音頻數據,隻要不損失數據的重要部分一定程度的質量下降是可以接受的。通過利用人類感知係統的侷限,能夠大幅度得節約存儲空間並且得到的結果質量與原始數據質量相比並冇有明顯的差彆。這些有損數據壓縮方法通常需要在壓縮速度、壓縮數據大小以及質量損失這三者之間進行折衷。\\n\\n有損圖像壓縮用於數碼相機中,大幅度地提高了存儲能力,同時圖像質量幾乎冇有降低。用於DVD的有損MPEG-2編解碼視頻壓縮也實現了類似的功能。\\n\\n在有損音頻壓縮中,心理聲學的方法用來去除信號中聽不見或者很難聽見的成分。人類語音的壓縮經常使用更加專業的技術,因此人們有時也將“語音壓縮”或者“語音編碼”作為一個獨立的研究領域與“音頻壓縮”區分開來。不同的音頻和語音壓縮標準都屬於音頻編解碼範疇。例如語音壓縮用於因特網電話,而音頻壓縮被用於CD翻錄並且使用MP3播放器解碼。\\n\\n理論\\n\\n壓縮的理論基礎是資訊論(它與演算法資訊論密切相關)以及率失真理論,這個領域的研究工作主要是由ClaudeShannon奠定的,他在二十世紀四十年代末期及五十年代早期發表了這方麵的基礎性的論文。Doyle和Carlson在2000年寫道數據壓縮“有所有的工程領域最簡單、最優美的設計理論之一”。密碼學與編碼理論也是密切相關的學科,數據壓縮的思想與統計推斷也有很深的淵源。\\n\\n許多無損數據壓縮係統都可以看作是四步模型,有損數據壓縮係統通常包含更多的步驟,例如它包括預測、頻率變換以及量化。\\n\\n流行演算法\\n\\nLempel-Ziv(LZ)壓縮方法是最流行的無損存儲演算法之一。DEFLATE是LZ的一個變體,它針對解壓速度與壓縮率進行了優化,雖然它的壓縮速度可能非常緩慢,PKZIP、gzip以及PNG都在使用DEFLATE。LZW(Lempel-Ziv-Welch)是Unisys的專利,直到2003年6月專利到期限,這種方法用於GIF圖像。另外值得一提的是LZR(LZ-Renau)方法,它是Zip方法的基礎。LZ方法使用基於表格的壓縮模型,其中表格中的條目用重複的數據串替換。對於大多數的LZ方法來說,這個表格是從最初的輸入數據動態生成的。這個表格經常采用霍夫曼編碼維護(例如,SHRI、LZX)。目前一個效能良好基於LZ的編碼機製是LZX,它用於微軟公司的CAB格式。\\n\\n演算法編碼\\n\\n最好的壓縮工具將概率模型預測結果用於算術編碼。算術編碼由JormaRissanen發明,並且由Witten、Neal以及Cleary將它轉變成一個實用的方法。這種方法能夠實現比眾人皆知的哈夫曼演算法更好的壓縮,並且它本身非常適合於自適應數據壓縮,自適應數據壓縮的預測與上下文密切相關。算術編碼已經用於二值圖像壓縮標準JBIG、文檔壓縮標準DejaVu。文字輸入係統Dasher是一個逆算術編碼器。\\n\\n類型\\n\\n數據壓縮可分成兩種類型,一種叫做無損壓縮,另一種叫做有損壓縮。\\n\\n無損壓縮是指使用壓縮後的數據進行重構(或者叫做還原,解壓縮),重構後的數據與原來的數據完全相同;無損壓縮用於要求重構的信號與原始信號完全一致的場合。一個很常見的例子是磁盤檔案的壓縮。根據目前的技術水平,無損壓縮演算法一般可以把普通檔案的數據壓縮到原來的1\\/2~1\\/4。一些常用的無損壓縮演算法有霍夫曼(Huffman)演算法和LZW(Lenpel-Ziv&Welch)壓縮演算法。\\n\\n有損壓縮是指使用壓縮後的數據進行重構,重構後的數據與原來的數據有所不同,但不影響人對原始資料表達的資訊造成誤解。有損壓縮適用於重構信號不一定非要和原始信號完全相同的場合。例如,圖像和聲音的壓縮就可以采用有損壓縮,因為其中包含的數據往往多於我們的視覺係統和聽覺係統所能接收的資訊,丟掉一些數據而不至於對聲音或者圖像所表達的意思產生誤解,但可大大提高壓縮比。\\n\\n數據庫管理係統\\n\\n數據庫管理係統(databasemanagementsystem)是一種操縱和管理數據庫的大型軟件,用於建立、使用和維護數據庫,簡稱dbms。它對數據庫進行統一的管理和控製,以保證數據庫的安全性和完整性。用戶通過dbms訪問數據庫中的數據,數據庫管理員也通過dbms進行數據庫的維護工作。它可使多個應用程式和用戶用不同的方法在同時或不同時刻去建立,修改和詢問數據庫。DBMS提供數據定義語言DDL(DataDefinitionLanguage)與數據操作語言DML(DataManipulationLanguage),供用戶定義數據庫的模式結構與權限約束,實現對數據的追加、刪除等操作。\\n\\n1.數據定義:DBMS提供數據定義語言DDL(DataDefinitionLanguage),供用戶定義數據庫的三級模式結構、兩級映像以及完整性約束和保密限製等約束。DDL主要用於建立、修改數據庫的庫結構。DDL所描述的庫結構僅僅給出了數據庫的框架,數據庫的框架資訊被存放在數據字典(DataDictionary)中。\\n\\n2.數據操作:DBMS提供數據操作語言DML(DataManipulationLanguage),供用戶實現對數據的追加、刪除、更新、查詢等操作。\\n\\n3.數據庫的運行管理:數據庫的運行管理功能是DBMS的運行控製、管理功能,包括多用戶環境下的併發控製、安全性檢查和存取限製控製、完整性檢查和執行、運行日誌的組織管理、事務的管理和自動恢複,即保證事務的原子性。這些功能保證了數據庫係統的正常運行。\\n\\n4.數據組織、存儲與管理:DBMS要分類組織、存儲和管理各種數據,包括數據字典、用戶數據、存取路徑等,需確定以何種檔案結構和存取方式在存儲級上組織這些數據,如何實現數據之間的聯絡。數據組織和存儲的基本目標是提高存儲空間利用率,選擇合適的存取方法提高存取效率。\\n\\n5.數據庫的保護:數據庫中的數據是資訊社會的戰略資源,隨數據的保護至關重要。DBMS對數據庫的保護通過4個方麵來實現:數據庫的恢複、數據庫的併發控製、數據庫的完整性控製、數據庫安全性控製。DBMS的其他保護功能還有係統緩衝區的管理以及數據存儲的某些自適應調節機製等。\\n\\n6.數據庫的維護:這一部分包括數據庫的數據載入、轉換、轉儲、數據庫的重組合重構以及效能監控等功能,這些功能分彆由各個使用程式來完成。\\n\\n7.通訊:DBMS具有與操作係統的聯機處理、分時係統及遠程作業輸入的相關介麵,負責處理數據的傳送。對網絡環境下的數據庫係統,還應該包括DBMS與網絡中其他軟件係統的通訊功能以及數據庫之間的互操作功能。\\n\\n層次結構\\n\\n根據處理對象的不同,數據庫管理係統的層次結構由高級到低級依次為應用層、語言翻譯處理層、數據存取層、數據存儲層、操作係統。\\n\\n(1)應用層\\n\\n應用層是DBMS與終端用戶和應用程式的介麵層,處理的對象是各種各樣的數據庫應用。\\n\\n(2)語言翻譯處理層\\n\\n語言翻譯處理層是對數據庫語言的各類語句進行語法分析、視圖轉換、授權檢查、完整性檢查等。\\n\\n(3)數據存取層\\n\\n數據存取層處理的對象是單個元組,它將上層的集合操作轉換為單記錄操作。\\n\\n(4)數據存儲層\\n\\n數據存儲層處理的對象是數據頁和係統緩衝區。\\n\\n(5)操作係統\\n\\n操作係統是DBMS的基礎。操作係統提供的存取原語和基本的存取方法通常是作為和DBMS存儲層的介麵。\\n\\n技術特點\\n\\n(1)采用複雜的數據模型表示數據結構,數據冗餘小,易擴充,實現了數據共享。\\n\\n(2)具有較高的數據和程式獨立性,數據庫的獨立性有物理獨立性和邏輯獨立性。\\n\\n(3)數據庫係統為用戶提供了方便的用戶介麵。\\n\\n(4)數據庫係統提供4個方麵的數據控製功能,分彆是併發控製、恢複、完整性和安全性。數據庫中各個應用程式所使用的數據由數據庫係統統一規定,按照一定的數據模型組織和建立,由係統統一管理和集中控製。\\n\\n(5)增加了係統的靈活性。\\n\\n常見品牌\\n\\nMSSQL\\n\\nSYBASE\\n\\nDB2\\n\\nORACLE\\n\\nMySQL\\n\\nACCESS\\n\\nVF\\n\\n選擇原則\\n\\n選擇數據庫管理係統時應從以下幾個方麵予以考慮:\\n\\n(1)構造數據庫的難易程度。\\n\\n需要分析數據庫管理係統有冇有範式的要求,即是否必須按照係統所規定的數據模型分析現實世界,建立相應的模型;數據庫管理語句是否符合國際標準,符合國際標準則便於係統的維護、開發、移植;有冇有麵向用戶的易用的開發工具;所支援的數據庫容量,數據庫的容量特性決定了數據庫管理係統的使用範圍。\\n\\n(2)程式開發的難易程度。\\n\\n有無計算機輔助軟件工程工具CASE——計算機輔助軟件工程工具可以幫助開發者根據軟件工程的方法提供各開發階段的維護、編碼環境,便於複雜軟件的開發、維護。有無第四代語言的開發平台——第四代語言具有非過程語言的設計方法,用戶不需編寫複雜的過程性代碼,易學、易懂、易維護。有無麵向對象的設計平台——麵向對象的設計思想十分接近人類的邏輯思維方式,便於開發和維護。對多媒體數據類型的支援——多媒體數據需求是今後發展的趨勢,支援多媒體數據類型的數據庫管理係統必將減少應用程式的開發和維護工作。\\n\\n(3)數據庫管理係統的效能分析。\\n\\n包括效能評估(響應時間、數據單位時間吞吐量)、效能監控(內外存使用情況、係統輸入\\/輸出速率、SQL語句的執行,數據庫元組控製)、效能管理(參數設定與調整)。\\n\\n(4)對分散式應用的支援。\\n\\n包括數據透明與網絡透明程度。數據透明是指用戶在應用中不需指出數據在網絡中的什麼節點上,數據庫管理係統可以自動搜尋網絡,提取所需數據;網絡透明是指用戶在應用中無需指出網絡所采用的協議。數據庫管理係統自動將數據包轉換成相應的協議數據。\\n\\n(5)並行處理能力。\\n\\n支援多CPU模式的係統(**P,CLUSTER,MPP),負載的分配形式,並行處理的顆粒度、範圍。\\n\\n(6)可移植性和可擴展性。\\n\\n可移植性指垂直擴展和水平擴展能力。垂直擴展要求新平台能夠支援低版本的平台,數據庫客戶機\\/服務器機製支援集中式管理模式,這樣保證用戶以前的投資和係統;水平擴展要求滿足硬體上的擴展,支援從單CPU模式轉換成多CPU並行機模式(**P,CLUSTER,MPP)\\n\\n(7)數據完整性約束。\\n\\n數據完整性指數據的正確性和一致性保護,包括實體完整性、參照完整性、複雜的事務規則。\\n\\n(8)併發控製功能。\\n\\n對於分散式數據庫管理係統,併發控製功能是必不可少的。因為它麵臨的是多任務分佈環境,可能會有多個用戶點在同一時刻對同一數據進行讀或寫操作,為了保證數據的一致性,需要由數據庫管理係統的併發控製功能來完成。評價併發控製的標準應從下麵幾方麵加以考慮:保證查詢結果一致性方法\\n\\n數據鎖的顆粒度(數據鎖的控製範圍,表、頁、元組等)數據鎖的升級管理功能\\n\\n死鎖的檢測和解決方法\\n\\n(9)容錯能力。\\n\\n異常情況下對數據的容錯處理。評價標準:硬體的容錯,有無磁盤鏡象處理功能軟件的容錯,有無軟件方法異常情況的容錯功能\\n\\n(10)安全性控製\\n\\n包括安全保密的程度(帳戶管理、用戶權限、網絡安全控製、數據約束)\\n\\n(11)支援多種文字處理能力\\n\\n包括數據庫描述語言的多種文字處理能力(表名、域名、數據)和數據庫開發工具對多種文字的支援能力。\\n\\n(12)數據恢複的能力\\n\\n當突然停電、出現硬體故障、軟件失效、病毒或嚴重錯誤操作時,係統應提供恢複數據庫的功能,如定期轉存、恢複備份、回滾等,使係統有能力將數據庫恢複到損壞以前的狀態。\\n\\n\"

}

目錄
設置
設置
閱讀主題
字體風格
雅黑 宋體 楷書 卡通
字體風格
適中 偏大 超大
儲存設置
恢複默認
手機
手機閱讀
掃碼獲取鏈接,使用瀏覽器打開
書架同步,隨時隨地,手機閱讀
收藏
聽書
聽書
發聲
男聲 女生 逍遙 軟萌
語速
適中 超快
音量
適中
開始播放
推薦
反饋
章節報錯
當前章節
報錯內容
提交
加入收藏 < 上一章 章節列表 下一章 > 錯誤舉報