Jump to content

CiteSeerX

Վիքիպեդիայից՝ ազատ հանրագիտարանից
(Վերահղված է CiteSeerX (identifier)ից)
CiteSeerX
Open-access repository, ազատ և բաց ծրագրային ապահովում, data library Խմբագրել Wikidata
Վերադաս կազմակերպությունՓենսիլվանիա նահանգի համալսարան
 Penn State College of Information Sciences and Technology Խմբագրել Wikidata
Հիմնական թեմաքիմիա Խմբագրել Wikidata
Ծրագրավորման լեզուՋավա Խմբագրել Wikidata
Պաշտոնական կայքciteseerx.ist.psu.edu Խմբագրել Wikidata
ԹույլատրագիրApache License 2.0 Խմբագրել Wikidata

CiteSeerX-ը (նախկինում՝ CiteSeer) հանրային որոնողական համակարգ և թվային գրադարան գիտական ​​և ակադեմիական հոդվածների համար, հիմնականում համակարգչային և տեղեկատվական գիտությունների ոլորտներում[1]։

CiteSeer-ի նպատակն է բարելավել ակադեմիական և գիտական ​​գրականության տարածումը և հասանելիությունը։ Որպես ոչ առևտրային ծառայություն, որը կարող է ազատորեն օգտագործվել յուրաքանչյուրի կողմից, այն համարվել է բաց մուտքի շարժման մաս, որը փորձում է փոխել ակադեմիական և գիտական ​​հրատարակչությունը՝ գիտական ​​գրականությանը ավելի մեծ հասանելիություն ապահովելու համար։ CiteSeer-ը անվճար տրամադրում է Բաց արխիվների նախաձեռնության մետատվյալներ բոլոր ինդեքսավորված փաստաթղթերի համար և հնարավորության դեպքում կապում է ինդեքսավորված փաստաթղթերը մետատվյալների այլ աղբյուրների հետ, ինչպիսիք են DBLP-ն և ACM Portal-ը։ Բաց տվյալները խթանելու համար CiteSeerX-ը կիսվում է իր տվյալներով ոչ առևտրային նպատակներով՝ Creative Commons արտոնագրերի ներքո[1]:

CiteSeer-ը համարվում է ակադեմիական որոնման գործիքների, ինչպիսիք են Google Scholar-ը և Microsoft Academic Search-ը, նախորդը[2]: CiteSeer-անման շարժիչներն ու արխիվները սովորաբար հավաքում են միայն հրապարակայնորեն հասանելի կայքերից փաստաթղթեր և չեն սկանավորում հրատարակիչների կայքերը։ Այս պատճառով, այն հեղինակները, որոնց փաստաթղթերը ազատորեն հասանելի են, ավելի հավանական է, որ ներկայացված լինեն ինդեքսում։

CiteSeer-ը մի պահ իր անունը փոխեց ResearchIndex-ի, ապա նորից փոխեց այն[3]:

CiteSeer և CiteSeer.IST

[խմբագրել | խմբագրել կոդը]

CiteSeer-ը ստեղծվել է հետազոտողներ Լի Ջայլսի, Կուրտ Բոլաքերի և Սթիվ Լոուրենսի կողմից 1997 թվականին, երբ նրանք աշխատում էին NEC հետազոտական ​​ինստիտուտում (այժմ՝ NEC Labs), Փրինսթոն, Նյու Ջերսի, ԱՄՆ։ CiteSeer-ի նպատակն էր ակտիվորեն սկանավորել և հավաքել ակադեմիական և գիտական ​​փաստաթղթերը համացանցում և օգտագործել ինքնավար մեջբերումների ինդեքսավորում՝ թույլ տալով հարցումներ կատարել ըստ մեջբերումների կամ փաստաթղթերի, դասակարգելով դրանք ըստ մեջբերումների ազդեցության։ Մի ժամանակ այն կոչվում էր ResearchIndex։

CiteSeer-ը հանրային դարձավ 1998 թվականին և ուներ բազմաթիվ նոր հնարավորություններ, որոնք այդ ժամանակ անհասանելի էին ակադեմիական որոնողական համակարգերում։ Դրանց թվում էին.

  • Ինքնավար մեջբերումների ինդեքսավորումը ավտոմատ կերպով ստեղծեց մեջբերումների ինդեքս, որը կարող է օգտագործվել գրականության որոնման և գնահատման համար։ Մեջբերումների վիճակագրությունը և դրանց հետ կապված փաստաթղթերը հաշվարկվել են տվյալների բազայում մեջբերված բոլոր հոդվածների համար, այլ ոչ թե միայն ինդեքսավորված հոդվածների։
  • Հղումների հղումներ, որոնք թույլ են տալիս զննել տվյալների բազան՝ օգտագործելով մեջբերումների հղումներ։
  • Մեջբերումների համատեքստը ցույց է տվել տվյալ հոդվածի մեջբերումների համատեքստը՝ թույլ տալով հետազոտողին արագ և հեշտությամբ տեսնել, թե ինչ են ասում այլ հետազոտողներ հետաքրքրող հոդվածի մասին։
  • Առնչվող փաստաթղթերը ցուցադրվել են մեջբերումների և բառերի վրա հիմնված չափանիշների միջոցով, և յուրաքանչյուր փաստաթղթի համար ցուցադրվում է ակտիվ և անընդհատ թարմացվող մատենագրություն։ CiteSeer-ը 2001 թվականի սեպտեմբերի 11-ին ստացել է ԱՄՆ # 6289342 արտոնագիրը՝ «Ինքնուրույն մեջբերումների ինդեքսավորում և գրականության դիտում մեջբերումների համատեքստի միջոցով» վերնագրով։ Արտոնագիրը ներկայացվել է 1998 թվականի մայիսի 20-ին և առաջնահերթություն ունի մինչև 1998 թվականի հունվարի 5-ը։

NEC-ից հետո, 2004 թվականին, այն հյուրընկալվել է որպես CiteSeer.IST Համաշխարհային ցանցում՝ Փենսիլվանիայի պետական ​​համալսարանի Տեղեկատվական գիտությունների և տեխնոլոգիաների քոլեջում, և ուներ ավելի քան 700,000 փաստաթուղթ։ Ավելի լավ մուտքի, արդյունավետության և հետազոտության համար CiteSeer-ի նմանատիպ տարբերակները աջակցվել են այնպիսի համալսարաններում, ինչպիսիք են Մասաչուսեթսի տեխնոլոգիական ինստիտուտը, Ցյուրիխի համալսարանը և Սինգապուրի ազգային համալսարանը։ Սակայն CiteSeer-ի այս տարբերակները դժվար էր պահպանել և այլևս հասանելի չեն։ Քանի որ CiteSeer-ը ինդեքսավորում է միայն համացանցում ազատորեն հասանելի հոդվածները և չունի հրատարակչի մետատվյալներին մուտք գործելու հնարավորություն, այն վերադարձնում է ավելի քիչ մեջբերումների քանակ, քան այն կայքերը, ինչպիսիք են Google Scholar-ը, որոնք ունեն հրատարակչի մետատվյալներ։

CiteSeer-ը 2005 թվականից ի վեր համապարփակ կերպով չէր թարմացվել իր ճարտարապետության սահմանափակումների պատճառով։ Այն ուներ համակարգչային և տեղեկատվական գիտությունների ոլորտում հետազոտական ​​փաստաթղթերի ներկայացուցչական նմուշ, բայց սահմանափակ էր իր ընդգրկմամբ, քանի որ սահմանափակվում էր հրապարակայնորեն մատչելի հոդվածներով, սովորաբար հեղինակի գլխավոր էջում, կամ հեղինակի կողմից ներկայացված հոդվածներով։ Այս սահմանափակումներից մի քանիսը հաղթահարելու համար մշակվել է CiteSeer-ի մոդուլային և բաց կոդով ճարտարապետություն՝ CiteSeerX։

CiteSeerX-ը փոխարինեց CiteSeer-ին, և CiteSeer-ին ուղղված բոլոր հարցումները վերահասցեագրվեցին: CiteSeerX-ը[4] հանրային որոնողական համակարգ է, թվային գրադարան և պահոց գիտական ​​և ակադեմիական հոդվածների համար, որոնք հիմնականում կենտրոնանում են համակարգչային և տեղեկատվական գիտությունների վրա[4]: Այնուամենայնիվ, վերջերս CiteSeerX-ը ընդլայնվել է այլ գիտական ​​ոլորտներ, ինչպիսիք են տնտեսագիտությունը, ֆիզիկան և այլն: Թողարկվելով 2008 թվականին, այն մասամբ հիմնված էր նախորդ CiteSeer որոնողական համակարգի և թվային գրադարանի վրա և կառուցված է SeerSuite-ի նոր բաց կոդով ենթակառուցվածքով, նոր ալգորիթմներով և դրանց իրականացումներով: Այն մշակվել է հետազոտողներ Իսահակ Քաունսիլի և Ս. Լի Ջայլսի կողմից Փենսիլվանիայի պետական ​​համալսարանի Տեղեկատվական գիտությունների և տեխնոլոգիաների քոլեջում: Այն շարունակում է աջակցել CiteSeer-ի կողմից սահմանված նպատակներին՝ ակտիվորեն որոնել և հավաքել ակադեմիական և գիտական ​​փաստաթղթեր հանրային ցանցում, ինչպես նաև օգտագործել հղումների հարցումը հղումների միջոցով և դասակարգել փաստաթղթերը հղումների ազդեցության միջոցով: Ներկայումս Լի Ջայլսը, Պրասենջիտ Միտրան, Սյուզան Գաուչը, Մին-Յեն Կանը, Պրադիպ Թերեգոուդան, Խուան Պաբլո Ֆերնանդես Ռամիրեսը, Պուկտադա Թրիրապիտուկը, Ջիան Վուն, Հունգ-Հսուան Չենը, Մադիան Խաբսան, Քայլ Ուիլյամսը, Դուգլաս Ջորդանը, Սթիվ Քարմանը, Ջեք Քերոլը, Ջիմ Ջանսենը և Շույի Չժենգը ակտիվորեն մասնակցել են կամ մասնակցել են դրա մշակմանը: Վերջերս ներդրվել է աղյուսակային որոնման գործառույթ[5]: Այն ֆինանսավորվել է Ազգային գիտական ​​հիմնադրամի, NASA-ի և Microsoft Research-ի կողմից:

CiteSeerX-ը շարունակում է գնահատվել որպես աշխարհի լավագույն պահոցներից մեկը և 2010 թվականի հուլիսին արժանացել է առաջին հորիզոնականին[6]: Այն ներկայումս ունի ավելի քան 6 միլիոն փաստաթուղթ՝ գրեթե 6 միլիոն եզակի հեղինակներով և 120 միլիոն հղումներով։

CiteSeerX-ը նաև կիսվում է իր ծրագրաշարով, տվյալներով, տվյալների բազաներով և մետատվյալներով այլ հետազոտողների հետ, ներկայումս՝ Amazon S3-ի և rsync-ի կողմից[7]: Դրա նոր մոդուլային բաց կոդով ճարտարապետությունը և ծրագիրը (նախկինում հասանելի էր SourceForge-ում, բայց այժմ՝ GitHub-ում) կառուցված են Apache Solr-ի և այլ Apache ու բաց կոդով գործիքների վրա, ինչը թույլ է տալիս այն լինել փաստաթղթերի հավաքագրման, դասակարգման, ինդեքսավորման և տեղեկատվության արդյունահանման նոր ալգորիթմների փորձարկման հարթակ։

CiteSeerX-ը քեշավորում է որոշ PDF ֆայլեր, որոնք սկանավորել է։ Այսպիսով, յուրաքանչյուր էջ ներառում է DMCA հղում, որը կարող է օգտագործվել հեղինակային իրավունքի խախտումների մասին հաղորդելու համար[8]:

Ընթացիկ հնարավորություններ

[խմբագրել | խմբագրել կոդը]

Տեղեկատվության ավտոմատացված արդյունահանում

[խմբագրել | խմբագրել կոդը]

CiteSeerX-ը օգտագործում է տեղեկատվության ավտոմատացված արդյունահանման գործիքներ, որոնք սովորաբար կառուցված են մեքենայական ուսուցման մեթոդների վրա, ինչպիսին է ParsCit-ը, գիտական ​​փաստաթղթերի մետատվյալներ, ինչպիսիք են վերնագիրը, հեղինակները, ամփոփագիրը, մեջբերումները և այլն, արդյունահանելու համար։ Հետևաբար, երբեմն սխալներ են լինում հեղինակների և վերնագրերի մեջ։ Այլ ակադեմիական որոնողական համակարգերն ունեն նմանատիպ սխալներ։

Կենտրոնացված սողացում

[խմբագրել | խմբագրել կոդը]

CiteSeerX-ը սողում է հրապարակայնորեն մատչելի գիտական ​​փաստաթղթերը հիմնականում հեղինակների վեբ էջերից և այլ բաց ռեսուրսներից և չունի հասանելիություն հրատարակչի մետատվյալներին։ Հետևաբար, CiteSeerX-ում մեջբերումների քանակը սովորաբար ավելի քիչ է, քան Google Scholar-ում և Microsoft Academic Search-ում, որոնք հասանելիություն ունեն հրատարակչի մետատվյալներին։

CiteSeerX-ը ունի գրեթե մեկ միլիոն օգտատեր ամբողջ աշխարհում՝ հիմնվելով եզակի IP հասցեների վրա և օրական միլիոնավոր այցելություններ է ունենում: PDF փաստաթղթերի տարեկան ներբեռնումները 2015 թվականին կազմել են գրեթե 200 միլիոն: CiteseerX-ը այժմ փակ է Փենսիլվանիայի պետական ​​համալսարանի կողմից ֆինանսավորման և աջակցության բացակայության պատճառով: Դրա տվյալները ֆինանսավորվում են Ինտերնետային արխիվից և AWS-ից:

CiteSeerX-ի տվյալները պարբերաբար տարածվել են Creative Commons BY-NC-SA լիցենզիայի ներքո ամբողջ աշխարհի հետազոտողների հետ և օգտագործվել են և օգտագործվում են բազմաթիվ փորձերի և մրցույթների ժամանակ:

OAI-PMH վերջնակետի շնորհիվ[9], CiteSeerX-ը բաց արխիվ է, և դրա բովանդակությունը ինդեքսավորվում է որպես ինստիտուցիոնալ պահոց ակադեմիական որոնողական համակարգերում, օրինակ՝ BASE և Unpaywall սպառողների մոտ:

SeerSuite-ի վրա հիմնված այլ որոնողական համակարգեր

[խմբագրել | խմբագրել կոդը]

CiteSeer մոդելը ընդլայնվել է՝ ներառելու SmealSearch-ի հետ բիզնեսում և eBizSearch-ի հետ էլեկտրոնային բիզնեսում ակադեմիական փաստաթղթերը: Սակայն դրանք չեն պահպանվել իրենց հովանավորների կողմից: Այս երկուսի ավելի հին տարբերակը մի ժամանակ կարելի էր գտնել BizSeer.IST-ում, բայց այլևս չի գործում։

Seer-անման այլ որոնման և պահոցային համակարգեր են կառուցվել քիմիայի (ChemXSeer) և հնագիտության (ArchSeer) համար։ Մեկ այլ՝ BotSeer-ը, կառուցվել էր robots.txt ֆայլերի որոնման համար։ Այս բոլորը կառուցված են SeerSuite բաց կոդով գործիքի վրա, որն օգտագործում է Lucene բաց կոդով ինդեքսատորը։

Ծանոթագրություններ

[խմբագրել | խմբագրել կոդը]
  1. 1 2 «CiteSeerX Data Policy». Արխիվացված է օրիգինալից 2012-01-05-ին. Վերցված է 2015-11-10-ին.
  2. Kodakateri Pudhiyaveetil, Ajith; Gauch, Susan; Luong, Hiep; Eno, Josh (2009). «Conceptual recommender system for CiteSeerX». Proceedings of the third ACM conference on Recommender systems. New York: ACM Press. էջ 241. doi:10.1145/1639714.1639758. ISBN 978-1-60558-435-5. S2CID 13900679.
  3. Lawrence, Steve (2001). «ResearchIndex: Inside the world's largest free full-text index of scientific literature». Proceedings of the international conference on Knowledge capture - K-CAP 2001. էջ 3. doi:10.1145/500737.500740. ISBN 1-58113-380-4. S2CID 19592721.
  4. 1 2 «About CiteSeerX». Արխիվացված օրիգինալից 2010-07-22-ին. Վերցված է 2010-05-07-ին.
  5. «The CiteSeerX Team». Pennsylvania State University. Արխիվացված է օրիգինալից 2018-07-26-ին. Վերցված է 2018-05-01-ին.
  6. «Ranking Web of World Repositories: Top 800 Repositories». Cybermetrics Lab. 2010 թ․ հուլիս. Արխիվացված է օրիգինալից 2010-07-24-ին. Վերցված է 2010-07-24-ին.
  7. «About CiteSeerX Data». Pennsylvania State University. Արխիվացված է օրիգինալից 2012-01-05-ին. Վերցված է 2012-01-25-ին.
  8. For example, «CiteSeerx – DMCA Notice». CiteSeerX 10.1.1.604.4916. Արխիվացված է օրիգինալից 2022-03-18-ին. «The document with the identifier "10.1.1.604.4916" has been removed due to a DMCA takedown notice. If you believe the removal has been in error, please contact us through the feedback page, along with the identifier mentioned in this page.»
  9. Hirst, Tony (2011-12-08). «Using OAI-PMH as a Single Record Level Query Interface to Citeseer». Արխիվացված օրիգինալից 2020-11-24-ին. Վերցված է 2020-04-25-ին.

Գրականություն

[խմբագրել | խմբագրել կոդը]

Արտաքին հղումներ

[խմբագրել | խմբագրել կոդը]