Регистрирай се

Въздействието на данните и изкуствения интелект върху научното производство

Политическа перспектива за това как FAIR данните и управлението на ИИ могат да запазят надеждността на научната продукция.

Автори:

Портрет на Баренд Монс

Баренд Монс, почетен професор на Лайденския университет, член на борда на фондация GO FAIR и директор на LIFES, Лайденската инициатива за FAIR и справедлива наука

Портрет на Ари Баак

Ари Баак, член на управителния съвет на Асоциацията LIFES за FAIR и равнопоставена наука

Портрет на Коен Йонкърс

Коен Йонкърс, Европейска комисия, Съвместен изследователски център (JRC), Брюксел, Белгия

Изкуственият интелект трансформира начина, по който се провежда, комуникира и валидира науката. Той е наистина обещаващ, позволявайки разпознаване на модели в мащаби, с които никой човешки изследовател не може да се сравни, ускорявайки работните процеси и отваряйки нови пътища за открития. Но изкуственият интелект е и бърз, не е безгрешен и безразборен, докато науката е времеемка и педантична по своята същност. Напрежението между тези две реалности вече генерира сериозна дисфункция: потоп от генерирани от изкуствен интелект публикации и данни, влошено експертно оценяване, халюцинирани открития и ерозирано доверие в научните данни. Наборът от умения, необходими на бъдещите учени, се променя фундаментално и научната политика не е в крак с времето. Преодоляването на тази празнина е спешно.

Изкуственият интелект променя начина, по който се прави наука

Науката се е преместила от среда с оскъдни данни към среда, богата на данни, със забележителна скорост. Докато някога изследователите са генерирали скромни набори от данни и са съобщавали откритията си предимно чрез статии, четими за хора, сега те работят в ера на експоненциално генериране на данни. Голяма част от тях са високоразмерни, разпределени и обработваеми само от машини. Тази тенденция обаче не се отразява в реалното повторно използване на данни. За да се промени това, самите данни сега трябва да се третират като първокласен научен продукт, а не като страничен продукт на статиите.

Машините са отлични в намирането на модели в големи и сложни набори от данни. Но машините нямат присъщ концептуален модел на реалността, релевантна за човека. Резултатът е почти неограничен набор от модели, много от които са фалшиви, а някои подвеждащи. Централно предизвикателство за следващото поколение учени ще бъде да се ориентират в тази джунгла от модели: да различат смисления сигнал от статистическия шум. Човешкият надзор не е по избор; той е структурно необходим.

Политиците също трябва да са наясно, че изкуственият интелект в науката се простира далеч отвъд моделите с големи езици, които понастоящем доминират в обществения дискурс. По-широкият пейзаж включва машинно обучение за генериране на хипотези, автоматизирани експериментални работни процеси и разсъждения, базирани на графи от знания, като всяко от тях носи различни рискове и възможности, изискващи адаптирани управленски отговори.

Качеството на данните и инфраструктурата са пречката

Качеството на продукцията на изкуствения интелект в науката се определя пряко от качеството на данните. входFAIR данните (Findable, Accessible, Interoperable and Reusable, и все по-често разбирани като Fully AI Ready - напълно готови за изкуствен интелект) са основната предпоставка за отговорна наука, основана на изкуствен интелект. Без тях моделите на изкуствен интелект се обучават върху сурово, некурирано, потенциално пристрастно или дори изфабрикувано съдържание, което води до халюцинации, които могат да бъдат животозастрашаващи в клиничен контекст и систематично подкопават доверието в науката. Особено когато повторната употреба на лесно откриваеми данни се осъществява предимно от участници, които не са научно обосновани, като настоящите LLM компании.

Също толкова важно е използването на концептуални модели FAIR за ограничаване на ИИ. изходиЧрез предоставяне на структурирани семантични рамки, където всяка концепция е добре дефинирана, как те са свързани и какво се счита за валиден извод, тези модели значително намаляват риска от халюцинации и помагат да се гарантира, че генерираните от изкуствен интелект открития остават обясними, интерпретируеми и проверими от хората.

Кризата с почтеността в научните публикации засилва тези рискове. Системите с изкуствен интелект вече могат да генерират правдоподобни статии, данни и рецензии почти мигновено. Една водеща конференция за изкуствен интелект получи над 20 000 публикации само през 2025 г. Реакцията (учени, използващи изкуствен интелект за преглед на генерирани от изкуствен интелект статии) рискува да създаде затворен цикъл на обратна връзка, в който дефектните системи се оценяват взаимно без смислена външна проверка. FAIR данните, публикувани при източника, където произходът може да бъде проверен, са сред най-надеждните инструменти, налични за противодействие на тази тенденция.

В основата на всичко това стои структурен провал в стимулите. Изследователите все още се възнаграждават предимно за броя на статиите и процента на цитиране, показател, предназначен за ерата на оскъдни данни. Публикуването на висококачествени FAIR данни носи малко професионално признание и няма гарантирано покритие на финансирането. Това трябва да се промени.

Пропуските в управлението са остри

Техническото управление на данните в науката е в криза. Десетилетия зависимост от малък брой големи доставчици на облачни услуги, съчетани с правни инструменти като Закона за облачните услуги на САЩ, създадоха проблем със суверенитета на данните, който сега е остър, особено в светлината на неотдавнашната нестабилност в политиката на САЩ и нейното въздействие върху международно споделената изследователска инфраструктура. Много от основните световни ресурси за научни данни са на практика извън юрисдикционния контрол на институциите и общностите, които са ги генерирали.

Принципите FAIR, допълнени от Принципите CARE (които разглеждат правата и интересите на коренното население при управлението на данните), осигуряват съгласувана рамка за отговорно стопанисване. Заедно те определят условията, при които данните трябва да бъдат отворени или ограничени, за многократна употреба и суверенни. Концепцията за Интернет на FAIR данни и услуги (IFDS), в който данните остават при източника си и се посещават от оторизирани алгоритми, вместо да се копират и централизират, предлага практичен архитектурен отговор. В този модел изчислителните заявки пътуват до разпределени възли за данни; данните не пътуват до централизирани хранилища, освен ако не е неизбежно.

Равноправното участие в науката, основана на изкуствен интелект, изисква също така тази инфраструктура да бъде наистина достъпна. Институциите и общностите в Глобалния юг не могат да бъдат пасивни субекти на повторно използване на данни. В другия край на спектъра на свързаност, индустрията с интензивно използване на данни не бива да бъде изключвана. Разпределената FAIR инфраструктура, проектирана да избягва обвързване с доставчик и единични точки на отказ, е механизмът, чрез който става възможно значимото участие.

Какво трябва да направят политиците

Съгласуваният политически отговор изисква действия на няколко фронта:

  • Изисквайте стандарти за FAIR данни в публично финансираните изследвания. Финансиращите органи следва да направят публикуването на данни по FAIR условие за отпускане на безвъзмездни средства, а не препоръка.
  • Публикуването на данни за финансиране и FAIRification като допустими разходи за безвъзмездна финансова помощ. Инвестицията, необходима за генериране на висококачествени, машинно приложими данни, трябва да бъде призната и обхваната.
  • Повторното използване на предварително генерирани данни и поддържащата инфраструктура, допустими за разходи за изследвания, в предложенията за безвъзмездни средстваИнвестициите, необходими за съхраняване и предоставяне на висококачествени, машинно обработваеми данни, трябва да бъдат признати и обхванати.
  • Подкрепяйте стандарти, базирани на общността, а не решения, ръководени от доставчици. Отворената, оперативно съвместима инфраструктура, изградена върху минимални споделени стандарти, предотвратява обвързването и осигурява равни условия.
  • Инвестирайте в научна грамотност. Освен учените, гражданите, журналистите и политиците също се нуждаят от работно разбиране на възможностите и ограниченията на ИИ. Разликата между общественото възприятие и техническата реалност е риск за управлението.
  • Да се ​​въведат изисквания за произход и прозрачност за изкуствения интелект, използван в научните изследвания. Всяка система с изкуствен интелект, допринасяща за публикувани научни открития, следва да бъде задължена да разкрива произхода на данните за обучение, ограниченията и ограниченията на модела.

Науката е глобално обществено благо. Нейната цялост, справедливост и откритост не могат да бъдат само по себе си самодостатъчни; те изискват активни политически решения. Възможността за установяване на добро управление на ИИ в научното производство е отворена, но няма да остане такава завинаги. Решенията, взети сега относно стандартите за данни, инфраструктурата, стимулите и надзора, ще определят дали ИИ ускорява надеждната наука или систематично я подкопава.


Снимка от Getty Images за Unsplash+

Организиран в партньорство между Международния научен съвет (ISC) и Frontiers Policy Labs, този блог е част от... „Ново управление на науката през 21-ви век“" серия, служеща като динамичен дискусионен форум за лидерски мнения относно бъдещето на научното управление. Отклонявайки се от строго определените академични изследвания, инициативата обединява водещи световни гласове, за да представи остри, провокативни, но основани на доказателства и далновидни мнения. По този начин тя иска да допринесе за дефинирането на устойчив, приобщаващ и прозрачен модел на управление, подготвен за предизвикателствата на утрешния ден.

Вижте оригиналната публикация тук.

Отказ от отговорност
Информацията, мненията и препоръките, представени в нашите гост-блогове, са на отделните участници и не е задължително да отразяват ценностите и убежденията на Международния научен съвет.

Бъдете в крак с нашите бюлетини