استخرج النص الكامل من صفحة ويب
أداة استخراج النص تقرأ صفحة ويب وتعيد محتواها كنص عادي خالٍ من وسوم HTML وأكواد التصميم، محافظة على ترتيب الفقرات كما ظهرت في الصفحة. تناسب من يحتاج النص وحده دون أي تنسيق مصاحب، خصوصًا عند تمريره لأداة تحليل لا تفهم رموز HTML أصلًا.
شغّلها أونلاين
شغّل هذه المهمة على خوادمنا باستخدام حسابك. الأدوات المجانية تعمل داخل متصفحك، أما هذه فتُخصم من رصيدك في KIT حسب السعر الموضّح أعلاه.
الفرق بين هذه الأداة وأداة Markdown
أداة Markdown تحافظ على بنية العناوين والقوائم والروابط بصيغة تُفهم كتنسيق؛ بينما تعيد هذه الأداة نصًا عاديًا مسطحًا بلا أي رمز تنسيق إطلاقًا. من يحتاج تحليل النص بأداة إحصائية أو نموذج لغوي لا يهتم بالتنسيق، هذه الصيغة الأبسط أنسب له لأنها لا تحتاج تنظيف رموز إضافي بعد الاستخراج، ولا تُدخل رموزًا غريبة قد تربك أداة تحليل بسيطة لا تتوقع سوى نص عادي مباشر.
كيف تتعامل الأداة مع بنية الصفحة
تستبعد الأداة عناصر القائمة والتذييل والإعلانات الجانبية غير المرتبطة بالمحتوى الأساسي قدر الإمكان، وتفصل الفقرات بأسطر واضحة تحافظ على تسلسلها القرائي. النتيجة نص متصل يمكن نسخه مباشرة أو تمريره لأداة تحليل أخرى دون معالجة إضافية، وهو ما يوفر خطوة تنظيف كاملة كانت ستُنجز يدويًا بعد كل استخراج، وتستهلك وقتًا مضاعفًا مع كل صفحة إضافية تُضاف للمهمة الأكبر. توفير هذه الخطوة وحدها يبرر استخدام الأداة لمعالجة عدد كبير من الصفحات.
استخدامات نموذجية
تحليل محتوى صفحة إحصائيًا لحساب عدد الكلمات أو الكثافة الكلامية، تغذية نموذج بحث بمحتوى نصي خام، أو أرشفة نص صفحة لمرجعية لاحقة دون الحاجة لتنسيقها. باحثون ومحللو محتوى يستخدمونها كخطوة أولى قبل معالجة أعمق للنص، لأنها تختصر عليهم مرحلة تنظيف الكود يدويًا قبل بدء التحليل الفعلي على مجموعة كبيرة من الصفحات المختلفة المصدر والتصميم. هذا يعجّل بدء العمل الفعلي على البيانات بدل استهلاكه في التحضير.
السعر
نحو $0.041 لكل صفحة، وتعمل الأداة من هذه الصفحة أو عبر الـAPI لمن يحتاج استخراج نص عشرات الصفحات ضمن مهمة تحليل آلية. السعر ثابت للصفحة الواحدة بغض النظر عن طول النص المستخرج منها فعليًا، سواء كان فقرة قصيرة أو مقالًا كاملًا مطولًا يمتد لآلاف الكلمات المتصلة ببعضها، وهو ما يسهّل حساب تكلفة معالجة أرشيف كامل مقدّمًا قبل بدء المهمة فعليًا.
حالات الاستخدام
محلل محتوى يحسب كثافة الكلمات المفتاحية
يستخرج محلل تسويق النص الكامل لصفحة منافس ليحسب تكرار كلمات مفتاحية محددة دون تدخل عناصر التصميم في العدّ.
تغذية نموذج بحث داخلي بمحتوى نصي
يبني فريق تقني فهرس بحث داخلي من نص عدة صفحات مستخرج بصيغة نظيفة، دون وسوم HTML تُربك عملية الفهرسة.
أرشفة نص صفحة قانونية للرجوع إليها
يستخرج محمد الحربي نص صفحة سياسة خصوصية لمورد قبل توقيع عقد معه، ليحتفظ بنسخة نصية مرجعية منفصلة عن الرابط الأصلي.
الأسئلة الشائعة
ما الفرق بين هذه الأداة وأداة تحويل الصفحة إلى Markdown؟
هذه تعيد نصًا مسطحًا بلا أي تنسيق؛ أداة Markdown تحافظ على العناوين والقوائم والروابط كبنية منظمة.
هل تستبعد الأداة القوائم والتذييل تلقائيًا؟
تحاول استبعاد العناصر غير المرتبطة بالمحتوى الأساسي قدر الإمكان، لكن النتيجة قد تختلف حسب بنية كل موقع.
هل تُحفظ الصفحة بعد الاستخراج؟
لا، تُستخدم لإنتاج النص فقط ثم تُحذف دون الاحتفاظ بأي نسخة من محتواها.
كم تكلفة استخراج نص خمسين صفحة؟
نحو $2.05، بواقع $0.041 للصفحة الواحدة تقريبًا.
هل يحافظ الترتيب النصي على القراءة العربية الصحيحة؟
نعم، يُحافَظ على تسلسل الفقرات واتجاه النص العربي كما ظهر في الصفحة الأصلية.
هل أحتاج حسابًا للاستخدام؟
لا يوجد تسجيل دخول ولا حساب؛ الدفع مباشر عند كل طلب.
للمطوّرين — الوصول عبر API
كل ما في هذه الصفحة متاح برمجيًا. هذا القسم موجّه للفرق التقنية التي تريد ربط الأداة بأنظمتها الخاصة؛ بقية المستخدمين يمكنهم استخدام الأداة أعلاه مباشرة دون الحاجة لقراءة ما يلي.
الـEndpoint
صادِق على طلبك بترويسة Bearer، وأرسل طلب POST واحدًا لتدخل مهمتك قائمة التنفيذ فورًا؛ ثم تستلم النتيجة عبر webhook أو رابط موقّع.
استدعِ الخدمة من بيئتك
curl -X POST https://api.kit.forhosting.com/web/to-text \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"url":"https://ejemplo.com"}'const res = await fetch("https://api.kit.forhosting.com/web/to-text", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"url": "https://ejemplo.com"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/web/to-text",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"url": "https://ejemplo.com"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/web/to-text", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"url":"https://ejemplo.com"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"url":"https://ejemplo.com"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/web/to-text", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)مثال على الطلب
{
"url": "https://ejemplo.com"
}مثال على الاستجابة
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "web.to_text",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}الواجهة غير متزامنة: تستلم task_id فور الإرسال، ويمكنك الاستعلام عن الحالة بمعدل طلب واحد في الثانية.
الأسعار
السعر معلن كما تراه: لا tokens ولا نظام نقاط؛ وإن فشلت المهمة فلن تُحاسَب عليها.
الحدود
timeout_sec | 30 |
max_crawl_pages | 25 |
الأخطاء
| HTTP | الرمز | المعنى |
|---|---|---|
401 | unauthorized | مفتاح الوصول مفقود أو غير صالح؛ تحقق من ترويسة Bearer في طلبك. |
402 | insufficient_balance | رصيدك لا يكفي لتنفيذ هذه المهمة؛ أعد شحن الرصيد ثم أعد المحاولة. |
404 | unknown_type | نوع المهمة المطلوب غير موجود في الكتالوج — راجع الاسم المرسل في الطلب. |
429 | rate_limited | تجاوزت الحد المسموح من الطلبات؛ انتظر قليلًا ثم أعد المحاولة. |
422 | task_failed | لم تنجح معالجة المهمة، ولن تُحتسب عليك؛ أعد المحاولة أو راسلنا مباشرة. |