Exista un tool prin care poti sa extragi tot textul dintr-un site web, intr-un document word sa zicem?
Nu doar o pagina..as vrea toate paginile unui site web!
Multumesc anticipat!
Versiune printabilă
Exista un tool prin care poti sa extragi tot textul dintr-un site web, intr-un document word sa zicem?
Nu doar o pagina..as vrea toate paginile unui site web!
Multumesc anticipat!
de curiozitate...in ce situatie ti-ar trebui acest tool?
De exemplu:
lucrez la un proiect..caut text..adaug, mai vine altcineva cu o idee, se mai completeaza, etc.Apoi mult mai comod mi-ar la final sa analizez tot textul daca l-as avea in fata intr-un word sa zicem ,ci nu sa iau fiecare pagina a site-lui in parte, s-ar vedea greselile gramaticale mult mai bine, continut duplicat..etc!
Procedezi gresit dpmdv, incearca Evernote.
Din cate inteleg vrei un tool pentru web scrapping, poti folosi Google pe keyword-ul asta.
As fi si eu interesat de un astfel de tools mai complex daca se poate
Daca siteul are rss, poti lua continutul de acolo. Daca nu are, pune-i
teodor98 exista mai multe variante:
1. import•io - Structured Web Data Scraping <-- free, dar iti ia ceva pana inveti cum sa il folosesti. Merita incercat
2. de mana <--dar stiai asta, sunt sigur :)
3. un scraper custom (dar costa)
Cred ca explcatiile mele nu au fost corecte, multumusc colegilor pentru sfaturi si indicatii, insa nu este chiar ce vreau eu, programe gen Teleport
Eu as vrea ceva cum este aici ceva in genul asta, unde poti sa vezi textul de la TITLE, la META DESCRIPTON si tot textul din body etc!
Ceva asemanator cu ce este aici
dar repet as vrea sa bag adresa site-lui si toate paginile html sa iasa ..in word!
Asa s-ar vedea mult mai usor greselile gramaticale, se pot corecta mai rapid, se poate lucra mult mai usor cu textul, dupa mine!
@Mishu mare dreptate ai!
@ puthre exelent ca intodeauna!
Daca site-ul iti apartine, nu-i mai simplu sa-i faci un export?
cum?
detaliaza un pic!
intre timp am gasit si asta
o intrebare pentru colegi!
cum lucrati cu textul pentru web? cum il gestionati, ca sa spun asa? cum il verificati?
dupa ce este gata site-ul web, cum ii faceti o ultima verificare, corectura?
vad ca nimeni nu mai vine cu nici-o sugestie sau vre-un sfat, intre timp si eu am gasit cit de cit ceva, am si spus in posturile de mai sus!
Postul se poate inchide, multumesc!
Incearca FMiner - visual web scraping, web data extractor with macro recorder , exista si varianta trial de 15 zile.
90% RSS este incomplet.( doar daca e al tau si dai full access , ar merge) Sunt scripturi PHP si biblioteci , gen "placinta magica" care fac extractie de text complet pe calea feedului.
Treaba cu scraping e sofisticata si implica ori softuri platite ( combinate ca actiune) ori programare custon gen C#, pyton etc
Trebuie testezi pana iese, insa insemna mult timp pierdut.
Sunt si alte variante insa MA INDOIESC ca e scraping de pe propriul site. Asa ar fi cel mai usor.
try ubut sau altele similare.
Sunt in cautarea unui astfel de tool si eu!
teodor98 cum te-ai descurcat pana la urma?
A corectat de mana...
Si tie tot pentru corectat iti trebuie?