PHP HTML代码串截取代码


Posted in PHP onDecember 29, 2008

而且给的数据是HTML代码串,比如这样:
<div class=”aaa”><a href=”/aaa.php?id=1″>张三</a> 评论了 <a href=”/aaa.php?id=444″>李四</a> 分享的 <a href=”bbb.html”>一篇文章文章一长串的东西</a></div>
截取的时候是要截取 div 标签内部的东西,而且要保留HTML标签,只是对其中的文字做处理。比如我可能只是截取到“李四”的“李”字,但是如果就这样放到前端的话,“李四”前面的 a 标签是没有闭合的,所以截取之后要保证HTML的语法正确。
这个问题确实不太好搞,让我郁闷了两天。请注意,这只是一个字符串,只不过内容是HTML代码,是没有什么DOM的。如果是在前端处理就好办了,直接DOM获取,然后对里面的节点进行处理,最后把innerHTML 之类的东西输出就搞定了。现在可不行了,得换个思路。同事的思路是这样的:
遍历字符串的每一个字符。设置一个标记,碰到标签开始的标记< 就置为1,接下来的字符都不记数,然后碰到>之后再开始计数。对标签内部的字符串处理的时候,还要先判断当前字符的编码是不是可能是中文,一般来说PHP中 UTF-8 编码的中文字符的长度都是3,所以如果碰到是中文字符编码,就要跳过两个不记数……说到这里我自己头已经开始大了。个人认为这种方法很不爽,首先这种精致的逻辑不太容易控制,而且 UFT-8 编码下中文产生的长度有可能是3个或4个 所以代码的严密性值得怀疑。
我个人的思路是,用 Tidy 来搞(具体用法请看PHP手册吧)。昨天研究了一下那个 Tidy ,发现这个东西还是挺好用的。首先,把这个字符串转换成 Tidy 对象,这样:
$tidy = tidy_parse_string($str, array(), ‘utf8′); // 最后一个是设置编码的,注意,这里是utf8 ,不是utf-8,没有中间那个连线。
然后获取$tidy中的 body(因为转换之后$tidy会自动加上<head><body>等标签):
$body = tidy_get_body($tidy);
这个时候你可以用 var_dump 看一些 $body 的结构,会发现它把每个标签都变成了一个对应的对象,里面有相应的属性。举例来说,比如 <a href=”#”>sdf</a> ,这么一条语句对应的一些属性有:
name=>”a”
value => “<a href=”#”>sdf</a>”
child=> array{[0]=>一个文本节点对象,value是 sdf}
attribute=array{”href”=>”#”}
…..其他属性
可以看到,我们其实是可以单独去处理 a 标签对应节点下面的文字节点的值的,那样就不会破坏任何HTML完整性。原来我以为改变 a 标签中文字节点的值之后, a 标签的value也会跟着改变,那样我直接返回a标签对应节点的value就OK了,没想到不是那个样子,哎,所以处理过其中的文字之后还是要自己拼出新的HTML。
知道了Tidy对象的结构之后,一切就好办了,只要遍历所有的节点,对于本需求来说,就是找到那个 div 标签,然后开始处理里面的节点。代码如下:
if(mb_strwidth($subchild->value, ‘utf-8′) >= $len)
{
$subchild->value = mb_strimwidth($subchild->value, 0, $len, ‘…', ‘utf-8′);
$trimed_str .= $subchild->value;
break;
}
else
{
$trimed_str .= $subchild->value;
$len = $len - mb_strwidth($subchild->value, ‘utf-8′);
}
里面的$subchild 就是一个子节点。注意,这里使用了 mb_strwidth 来获取字符串长度。严重推荐一下这个 mb_strwidth,很好用,它会把中文当作两个字符长度处理,正好符合这里的需求!而且截取字符串的时候用到了 mb_strimwidth,这个函数也会把中文当作两个字符长度处理,mb_ 开头的函数真是好用啊。
具体代码我就不写出来了,因为是针对一个需求写的,没做成通用的形式。哪天我有时间做成通用的再发布一下。
另外,可惜FireFox不支持 text-overflow 属性,不然也不用后台那么辛苦地去截断了。如果大家有更好的方法,欢迎提出!不胜感激。

PHP 相关文章推荐
php 将bmp图片转为jpg等其他任意格式的图片
Jun 21 PHP
自动把纯文本转换成Web页面的php代码
Aug 27 PHP
PHP中SESSION使用中的一点经验总结
Mar 30 PHP
Fine Uploader文件上传组件应用介绍
Jan 06 PHP
php页码形式分页函数支持静态化地址及ajax分页
Mar 28 PHP
PHP中上传多个文件的表单设计例子
Nov 19 PHP
PHP Curl模拟登录微信公众平台、新浪微博实例代码
Jan 28 PHP
深入解析PHP的Yii框架中的event事件机制
Mar 17 PHP
php实现简单加入购物车功能
Mar 07 PHP
php生成0~1随机小数的方法(必看)
Apr 05 PHP
简单实现php上传文件功能
Sep 21 PHP
PHP守护进程化在C和PHP环境下的实现
Nov 21 PHP
PHP MSSQL 存储过程的方法
Dec 24 #PHP
php 获取完整url地址
Dec 20 #PHP
php xml-rpc远程调用
Dec 19 #PHP
php 设计模式之 工厂模式
Dec 19 #PHP
php 设计模式之 单例模式
Dec 19 #PHP
PHP 采集程序 常用函数
Dec 18 #PHP
php IP及IP段进行访问限制的代码
Dec 17 #PHP
You might like
PHP禁止个别IP访问网站
2013/10/30 PHP
PHP调试函数和日志记录函数分享
2015/01/31 PHP
变量在 PHP7 内部的实现(二)
2015/12/21 PHP
php 如何获取文件的后缀名
2016/06/05 PHP
关于JavaScript的一些看法
2009/05/27 Javascript
javascript 带有滚动条的表格,标题固定,带排序功能.
2009/11/13 Javascript
基于JQuery的简单实现折叠菜单代码
2010/09/15 Javascript
jQuery下扩展插件和拓展函数的写法(匿名函数使用的典型例子)
2010/10/20 Javascript
jQuery调用AJAX时Get和post公用的乱码解决方法实例说明
2013/06/04 Javascript
jQuery随便控制任意div隐藏的方法
2013/06/28 Javascript
JS中捕获console.log()输出的方法
2015/04/16 Javascript
遍历json获得数据的几种方法小结
2017/01/21 Javascript
Vue.js实战之Vuex的入门教程
2017/04/01 Javascript
浅谈vue的踩坑路
2017/08/31 Javascript
Three.js开发实现3D地图的实践过程总结
2017/11/20 Javascript
node.js利用socket.io实现多人在线匹配联机五子棋
2018/05/31 Javascript
javascript头像上传代码实例
2019/09/28 Javascript
如何编写一个 Webpack Loader的实现
2020/10/18 Javascript
JS相册图片抖动放大展示效果的示例代码
2021/01/29 Javascript
python多线程http下载实现示例
2013/12/30 Python
python matplotlib库绘制条形图练习题
2019/08/10 Python
Python序列对象与String类型内置方法详解
2019/10/22 Python
详解python破解zip文件密码的方法
2020/01/13 Python
Python3标准库之threading进程中管理并发操作方法
2020/03/30 Python
使用OpenCV获取图片连通域数量,并用不同颜色标记函
2020/06/04 Python
阿玛尼化妆品美国官网:Giorgio Armani Beauty
2017/02/02 全球购物
美国用餐电影院:Alamo Drafthouse Cinema
2020/01/23 全球购物
Set里的元素是不能重复的,那么用什么方法来区分重复与否呢? 是用==还是equals()? 它们有何区别?用contains来区分是否有重复的对象。还是都不用
2013/07/30 面试题
拖鞋店创业计划书
2014/01/15 职场文书
护士长竞聘书
2014/03/31 职场文书
健康家庭事迹材料
2014/05/02 职场文书
银行优秀员工事迹材料
2014/05/29 职场文书
2014年底个人工作总结
2015/03/10 职场文书
个人道歉信大全
2019/04/11 职场文书
2019毕业论文致谢词
2019/06/24 职场文书
JVM的类加载器和双亲委派模式你了解吗
2022/03/13 Java/Android