国产精品久久久aaaa,日日干夜夜操天天插,亚洲乱熟女香蕉一区二区三区少妇,99精品国产高清一区二区三区,国产成人精品一区二区色戒,久久久国产精品成人免费,亚洲精品毛片久久久久,99久久婷婷国产综合精品电影,国产一区二区三区任你鲁

0
  • 聊天消息
  • 系統消息
  • 評論與回復
登錄后你可以
  • 下載海量資料
  • 學習在線課程
  • 觀看技術視頻
  • 寫文章/發帖/加入社區
會員中心
創作中心

完善資料讓更多小伙伴認識你,還能領取20積分哦,立即完善>

3天內不再提示

在機器學習領域,數據和模型哪個更重要

智能感知與物聯網技術研究所 ? 來源:neptune.ai ? 作者:Harshil Patel ? 2022-03-24 14:16 ? 次閱讀
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

機器學習領域,數據重要還是模型重要?這是一個很難回答的問題。

模型和數據是 AI 系統的基礎,這兩個組件在模型的開發中扮演著重要的角色。

人工智能領域最權威的學者之一吳恩達曾提出「80% 的數據 + 20% 的模型 = 更好的機器學習」,他認為一個團隊研究 80% 的工作應該放在數據準備上,數據質量是重要的,但很少有人在乎。如果更多地強調以數據為中心而不是以模型為中心,機器學習會發展的更快。

我們不禁會問,機器學習的進步是模型帶來的還是數據帶來的,目前還沒有一個明確的答案。

在本文中,Android 開發者和機器學習愛好者 Harshil Patel 介紹了「機器學習:以數據為中心 VS 以模型為中心」,通過對比以確定兩者中哪個更重要,此外,Patel 還介紹了如何使用以數據為中心的基礎設施。

以數據為中心的方法 VS 以模型為中心的方法

以模型為中心的方法意味著需要通過實驗來提高機器學習模型性能,這涉及模型架構的選擇、訓練過程。而在以模型為中心的方法中,你需要保持數據相同,通過改進代碼和模型架構來提高性能。此外,對代碼的改進是以模型為中心的根本目標。

目前,大多數 AI 應用都是以模型為中心的,其中一個可能的原因是學術研究非常重視 AI 領域。根據吳恩達的說法,AI 領域 90% 以上的研究論文都是以模型為中心的,因為我們很難創建大型數據集,使其成為公認的標準。因此,AI 社區認為以模型為中心的機器學習更有前景。研究者在專注于模型的同時,往往會忽略數據的重要性。

對于研究者而言,數據是每個決策過程的核心,以數據為中心的公司通過使用其運營產生的信息,可以獲得更準確、更有條理、更透明的結果,從而可以幫助公司組織更順利地運行。以數據為中心的方法涉及系統地改進、改進數據集,以提高 ML 應用程序的準確性,對數據進行處理是以數據為中心的中心目標。

f0375be2-98a9-11ec-952b-dac502259ad0.png

數據驅動 VS 以數據為中心

許多人經?;煜敢詳祿橹行摹购汀笖祿寗印惯@兩個概念。數據驅動是一種從數據中收集、分析和提取見解的方法,它有時被稱為「分析」。另一方面,以數據為中心的方法側重于使用數據來定義應該首先創建的內容;而以數據為中心的架構指的是一個系統,其中數據是主要和永久的資產。數據驅動架構意味著通過利用大量數據來創建技術、技能和環境。

對于數據科學家和機器學習工程師來說,以模型為中心的方法似乎更受歡迎。這是因為從業者可以利用自身知識儲備來解決特定問題。另一方面,沒有人愿意花大量時間去標注數據。

然而,在當今的機器學習中,數據至關重要,但在 AI 發展中卻經常被忽視和處理不當。由于數據錯誤,研究者可能花費大量時間進行查錯。模型精度較低的根本原因可能不是來自模型本身,而是來自錯誤的數據集。

f04d9542-98a9-11ec-952b-dac502259ad0.png

除了關注數據外,模型和代碼也很重要。但研究者往往傾向于在關注模型的同時忽略數據的重要性。最好的方法是同時關注數據和模型的混合方法。根據應用程序的不同,研究者應該兼顧數據和模型。

以數據為中心的基礎架構

以模型為中心的機器學習系統主要關注模型架構優化及其參數優化。

f06851ca-98a9-11ec-952b-dac502259ad0.png

以模型為中心的 ML 應用程序

上圖中描述的是以模型為中心的工作流適用于少數行業,如媒體、廣告、醫療保健或制造業。但也可能面臨如下挑戰:

需要高級定制系統:不同于媒體和廣告行業,許多企業無法使用單一的機器學習系統來檢測其產品的生產故障。雖然媒體公司可以負擔得起有一個完整的 ML 部門來處理優化問題,但需要多個 ML 解決方案的制造企業不能按照這樣的模板進行實施;

大型數據集的重要性:在大多數情況下,公司沒有大量數據可供使用。相反,他們經常被迫處理微小的數據集,如果他們的方法是以模型為中心的,那么這些數據集很容易產生令人失望的結果。

吳恩達曾在他的 AI 演講中解釋了他如何相信以數據為中心的 ML 更有價值,并倡導社區朝著以數據為中心的方向發展。他曾經舉了一個「鋼鐵缺陷檢測」的例子,其中以模型為中心的方法未能提高模型的準確率,而以數據為中心的方法將準確率提高了 16%。

f07c738a-98a9-11ec-952b-dac502259ad0.png

以數據為中心的 ML 應用程序

在實施以數據為中心的架構時,可以將數據視為比應用程序和基礎架構更耐用的基本資產。以數據為中心的 ML 使數據共享和移動變得簡單。那么,在以數據為中心的機器學習到底涉及什么?在實現以數據為中心的方法時,我們應該考慮以下因素:

數據標簽質量:當大量的圖像被錯誤標記時,會出現意想不到的錯誤,因此需要提高數據標注質量;

數據增強:讓有限的數據產生更多的數據,增加訓練樣本的數量以及多樣性(噪聲數據),提升模型穩健性;

特征工程:通過改變輸入數據、先驗知識或算法向模型添加特征,常被用于機器學習,以幫助提高預測模型的準確性;

數據版本控制:開發人員通過比較兩個版本來跟蹤錯誤并查看沒有意義的內容,數據版本控制是維護數據中最不可或缺的步驟之一,它可以幫助研究者跟蹤數據集的更改(添加和刪除),版本控制使代碼協作和數據集管理變得更加容易;

領域知識:在以數據為中心的方法中,領域知識非常有價值。領域專家通??梢詸z測到 ML 工程師、數據科學家和標注人員無法檢測到的細微差異,ML 系統中仍然缺少涉及領域專家的內容。如果有額外的領域知識可用,ML 系統可能會表現得更好。

應該優先考慮哪一個:數據數量還是數據質量?

需要強調的是,數據量多并不等同于數據質量好。當然,訓練神經網絡不能只用幾張圖就能完成,數據數量是一個方面,但現在的重點是質量而不是數量。

f09187de-98a9-11ec-952b-dac502259ad0.png

如上圖所示,大多數 Kaggle 數據集并沒有那么大。在以數據為中心的方法中,數據集的大小并不那么重要,并且可以使用質量較小的數據集完成更多的工作。不過需要注意的是,數據質量高且標注正確。

上圖中是另一種標注數據的方式,單獨或組合標注。例如,如果數據科學家 1 單獨標注菠蘿,而數據科學家 2 將其組合標注,則兩者標注的數據不兼容,導致學習算法變得混亂。因此,需要將數據標簽保持一致;如果需要單獨標注,請確保所有標注都以相同的方式進行。

f0c2d94c-98a9-11ec-952b-dac502259ad0.png

上圖為吳恩達解釋了小數據集一致性的重要性

到底需要多少數據?

數據質量不可忽視,但數據量也是至關重要的,研究者必須有足夠的數據支撐才能解決問題。深度網絡具有低偏差、高方差特性,我們可以預見更多的數據可以解決方差問題。但是多少數據才夠呢?目前這個問題還很難回答,不過我們可以認為擁有大量的數據是一種優勢,但也不是必須的。

如果你采用以數據為中心的方法,請記住以下幾點:

確保在整個 ML 項目周期中數據保持一致;

數據標注保持一致;

要及時反饋結果;

進行錯誤分析;

消除噪聲樣本。

那么,我們哪里可以找到高質量的數據集?這里推薦幾個網站,首先是 Kaggle:在 Kaggle 中,你會找到進行數據科學工作所需的所有代碼和數據,Kaggle 擁有超過 50,000 個公共數據集和 400,000 個公共 notebook,可以快速完成任務。

f0deb1ee-98a9-11ec-952b-dac502259ad0.png

其次是 Datahub.io:Datahub 是一個主要專注于商業和金融的數據集平臺。許多數據集,例如國家、人口和地理邊界列表,目前在 DataHub 上可用。

f0f95f4e-98a9-11ec-952b-dac502259ad0.png

最后是 Graviti Open Datasets:Graviti 是一個新的數據平臺,主要為計算機視覺提供高質量的數據集。個人開發人員或組織可以輕松訪問、共享和更好地管理開放數據。

原文標題:90%論文都是以模型為中心,AI領域,數據和模型到底哪個重要?

文章出處:【微信公眾號:智能感知與物聯網技術研究所】歡迎添加關注!文章轉載請注明出處。

審核編輯:湯梓紅

聲明:本文內容及配圖由入駐作者撰寫或者入駐合作網站授權轉載。文章觀點僅代表作者本人,不代表電子發燒友網立場。文章及其配圖僅供工程師學習之用,如有內容侵權或者其他違規問題,請聯系本站處理。 舉報投訴
  • 數據
    +關注

    關注

    8

    文章

    7335

    瀏覽量

    94769
  • AI
    AI
    +關注

    關注

    91

    文章

    39793

    瀏覽量

    301402
  • 模型
    +關注

    關注

    1

    文章

    3752

    瀏覽量

    52109

原文標題:90%論文都是以模型為中心,AI領域,數據和模型到底哪個重要?

文章出處:【微信號:tyutcsplab,微信公眾號:智能感知與物聯網技術研究所】歡迎添加關注!文章轉載請注明出處。

收藏 人收藏
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

    評論

    相關推薦
    熱點推薦

    強化學習會讓自動駕駛模型學習更快嗎?

    是一種讓機器通過“試錯”學會決策的辦法。與監督學習不同,監督學習是有人提供示范答案,讓模型去模仿;而強化學習不會把每一步的“正確答案”都告訴
    的頭像 發表于 01-31 09:34 ?643次閱讀
    強化<b class='flag-5'>學習</b>會讓自動駕駛<b class='flag-5'>模型</b><b class='flag-5'>學習</b>更快嗎?

    機器學習和深度學習中需避免的 7 個常見錯誤與局限性

    ,并驗證輸出結果,就能不斷提升專業技能,養成優秀數據科學家的工作習慣。需避免的機器學習和深度學習數據錯誤
    的頭像 發表于 01-07 15:37 ?191次閱讀
    <b class='flag-5'>機器</b><b class='flag-5'>學習</b>和深度<b class='flag-5'>學習</b>中需避免的 7 個常見錯誤與局限性

    基于ETAS嵌入式AI工具鏈將機器學習模型部署到量產ECU

    AI汽車行業的應用日益深化,如何將機器學習領域的先進模型(如虛擬傳感器)集成到ECU軟件中,已成為業界面臨的核心挑戰。
    的頭像 發表于 12-24 10:55 ?6106次閱讀
    基于ETAS嵌入式AI工具鏈將<b class='flag-5'>機器</b><b class='flag-5'>學習</b><b class='flag-5'>模型</b>部署到量產ECU

    移動電源應用中,電容的高容值和低ESR,哪個對抑制紋波更重要?

    移動電源應用中,電容的高容值和低ESR,哪個對抑制紋波更重要
    發表于 12-06 13:30

    探索RISC-V機器領域的潛力

    Pro則運行控制節點,通過Wi-Fi網絡接收Gazebo發布的傳感器信息(如激光雷達數據),并發布控制指令(速度指令)來驅動機器模型移動和避障。 ? 體驗: MUSE Pi Pro的K1 CPU
    發表于 12-03 14:40

    超小型Neuton機器學習模型, 在任何系統級芯片(SoC)上解鎖邊緣人工智能應用.

    Neuton 是一家邊緣AI 公司,致力于讓機器 學習模型更易于使用。它創建的模型比競爭對手的框架小10 倍,速度也快10 倍,甚至可以
    發表于 07-31 11:38

    FPGA機器學習中的具體應用

    隨著機器學習和人工智能技術的迅猛發展,傳統的中央處理單元(CPU)和圖形處理單元(GPU)已經無法滿足高效處理大規模數據和復雜模型的需求。FPGA(現場可編程門陣列)作為一種靈活且高效
    的頭像 發表于 07-16 15:34 ?2890次閱讀

    最新人工智能硬件培訓AI 基礎入門學習課程參考2025版(大模型篇)

    教育等領域發揮著越來越重要的作用。?針對日前前來咨詢的廣大客戶對面向大模型智能硬件的學習需求,我們根據CSK6大模型語音視覺開發板已有功能,
    發表于 07-04 11:10

    模型半導體行業的應用可行性分析

    的應用,比如使用機器學習分析數據,提升良率。 這一些大模型是否真的有幫助 能夠解決工程師的知識斷層問題 本人純小白,不知道如何涉足這方面
    發表于 06-24 15:10

    明遠智睿SSD2351開發板:語音機器領域的變革力量

    人工智能快速發展的今天,語音機器人逐漸成為人們生活和工作中的得力助手。明遠智睿SSD2351開發板憑借強大性能與豐富功能,為語音機器人的發展注入新動力,成為該領域的變革力量。 SSD
    發表于 05-28 11:36

    網線機器領域如何發揮重要作用

    機器人制造領域正經歷前所未有的變革,網絡產品作為連接機器人內部系統與外部環境的關鍵紐帶,機器視覺、數據
    的頭像 發表于 04-27 13:33 ?863次閱讀

    國產地物光譜儀“高光譜-機器學習模型構建中的表現

    遙感應用和環境監測日益精細化的今天,“高光譜 + 機器學習”的組合已成為地物識別、礦產探測、農業監測等領域重要技術手段。而作為獲取高光譜
    的頭像 發表于 04-18 16:15 ?742次閱讀
    國產地物光譜儀<b class='flag-5'>在</b>“高光譜-<b class='flag-5'>機器</b><b class='flag-5'>學習</b>”<b class='flag-5'>模型</b>構建中的表現

    數據標注服務—奠定大模型訓練的數據基石

    數據標注是大模型訓練過程中不可或缺的基礎環節,其質量直接影響著模型的性能表現。模型訓練中,數據
    的頭像 發表于 03-21 10:30 ?3290次閱讀

    標貝數據標注服務:奠定大模型訓練的數據基石

    數據標注是大模型訓練過程中不可或缺的基礎環節,其質量直接影響著模型的性能表現。模型訓練中,數據
    的頭像 發表于 03-21 10:27 ?1110次閱讀
    標貝<b class='flag-5'>數據</b>標注服務:奠定大<b class='flag-5'>模型</b>訓練的<b class='flag-5'>數據</b>基石

    請問STM32部署機器學習算法硬件至少要使用哪個系列的芯片?

    STM32部署機器學習算法硬件至少要使用哪個系列的芯片?
    發表于 03-13 07:34